本发明属于车载音乐推荐,尤其涉及一种基于多模态神经网络模型的车载音乐推荐装置及方法。
背景技术:
1、随着互联网技术、数字音乐的不断发展,以及智能汽车的日趋成熟,人们身处于智能汽车车舱内的时长不断增加,如何有效地在向车内用户即时的推荐当下用户最感兴趣的音乐,成为提供个性化、智能化的数字音乐服务的关键问题。现有的音乐推荐方法主要包括以下几种:
2、①按照音乐的流派、节奏类型、音乐风格进行标签化推荐。即按照流派、节奏快慢、音乐风格等多个维度给音乐曲库中的音乐打上细分类别的标签,一组多维度的标签构成了一支音乐单曲的dna,然后根据用户偏好的流派标签、节奏标签、音乐风格标签来找到用户可能喜欢的音乐推荐给用户。
3、②协同过滤。即根据用户的年龄、性别、地域等信息对用户进行特征描述,然后搜集不同用户偏好的音乐,认为特征相似的用户会喜欢相似的音乐,从而将某一个用户喜欢的音乐推荐给另一个用户特征上相近的其他用户。
4、③基于评论文字的nlp推荐。即基于用户对单支音乐的评论文字进行自然语言处理模型分析,认为拥有类似评论文字的音乐是类似的,当用户的评论文字表现出对某支音乐的偏好时,尝试将其他有类似评论文字的音乐推荐给用户。
5、④基于用户行为序列的推荐。即搜集用户的互动操作,包括搜索、播放、切歌、收藏等,根据行为序列来判断用户的音乐偏好,再结合音乐标签向用户推荐类似的音乐。
6、现有技术中,由于在车内环境中,频繁的互动操作会明显降低用户体验,车载音乐推荐需要在尽量少的互动下,向用户推荐用户喜欢的音乐,在车内环境中用户也很少会对音乐进行文字评论,因此基于用户行为序列、基于评论文字的nlp推荐技术都不适用于车载音乐推荐场景。
7、车载音乐推荐的另一个问题是:智能汽车在行驶中用户当下喜欢的音乐不同于用户在通常室内静止环境中的偏好,而会随着智能汽车所处的外部风景的变化而变化,例如汽车穿行于寂静的林荫小道、或者行驶于风沙中的大漠,用户当下所需要的音乐和当时车外的风景有着密切的联系。但是按照音乐的流派、节奏、音乐风格形成用户偏好的音乐dna特征,仅能描述用户平时的常规音乐偏好,而无法随着用户所在的场景、外部风景而随机应变;协同过滤也存在类似的缺陷,协同过滤仅能描述用户的日常音乐偏好之间的重叠,当用户身处特定场景时,应该推荐怎样的音乐最符合当时当下,是协同过滤无法实现的需求。
8、现有专利文献一(公开号为cn117076758a)公开了“一种车载音乐推荐方法、装置及计算机存储介质”,通过获取用户交互信息以及驾驶场景信息,根据用户交互信息以及驾驶场景信息,获取预设音乐数据库中的候选音乐排序,根据所述候选音乐排序,向用户推荐音乐;需要收集用户交互信息,隐私性较差,驾驶场景信息是一些离散的数据。
9、现有专利文献二(公开号为cn116453555a)公开了“基于驾驶场景信息的音乐播放方法、装置及设备”,通过获取车内场景信息,判断车内场景信息是否满足预设的安静环境条件,确定待播放音乐的音量,并获取车外场景信息,确定与车内场景信息匹配的音乐类型;车内及车外场景信息是一些离散的数据。
10、现有专利文献三(公开号为cn106126591a)公开了“音乐数据推荐方法与系统”,通过采集汽车周围环境数据以及汽车行驶状态数据,根据所述汽车周围环境数据以及汽车行驶状态数据,从预设音乐数据库中选择匹配的音乐数据,推送查找到的音乐数据;汽车周围环境数据、汽车行驶状态数据是一些离散的数据。
11、现有专利文献四(公开号为cn113536028a)公开了“音乐的推荐方法和装置”,通过获取包括用户的驾驶习惯数据、用户心理状态、车辆所处道路的第一拥堵数据等数据的车载场景,并将待播放的多首歌曲的歌曲信息以及车载场景的数据作为输入参数输入至排序模型,从而输出排序模型排序后的各首歌曲;需要收集用户个人信息,隐私性较差,道路拥堵数据是离散的数据。
12、现有专利文献五(公开号为cn105335507a)公开了“一种推送歌曲的方法及装置”,通过获取用户当前环境的声音信息、位置信息以及运动状态,智能分析并判断用户当前所处的环境,再根据不同的当前环境,给用户推送不同的歌曲;环境信息是一些离散的数据。
技术实现思路
1、本发明目的在于解决现有技术中存在的上述技术问题,提供一种基于多模态神经网络模型的车载音乐推荐装置及方法,通过设计一种音乐即时推荐算法,根据即时的车外风景向用户推荐与风景意象相匹配的音乐,解决了现有音乐推荐算法在智能车载音乐推荐中无法随时随地根据外部视觉风景推荐合适的音乐的缺陷。
2、为了解决上述技术问题,本发明采用如下技术方案:
3、一种基于多模态神经网络模型的车载音乐推荐装置,其特征在于,包括:
4、车载外景图像采集器,用于对汽车外的风景图片进行采集;
5、图像-音乐多模态描述模型,用于根据车载外景图像采集器输入的汽车外风景图片,生成对应的图像-音乐多模态描述向量;
6、音乐向量搜索器,用于在音乐曲库中检索与图像-音乐多模态描述向量距离最近的音乐,作为推荐结果推送给用户。
7、进一步,图像-音乐多模态描述模型包括图像编码器分支和音乐编码器分支,图像编码器分支用于采用transformer神经网络结构对输入的图像进行编码描述,音乐编码器分支用于采用transformer神经网络结构对输入的音乐代表旋律片段进行编码描述。
8、一种基于多模态神经网络模型的车载音乐推荐方法,其特征在于,包括如下步骤:
9、s201:对音乐曲库中的每一支音乐选取对应的代表旋律片段,调用图像-音乐多模态描述模型,将每一支音乐的代表旋律片段转化为一个图像-音乐多模态描述向量,并存放在音乐向量库中,作为该支音乐在音乐向量库中的代表向量;
10、s202:当用户需要车载音乐推荐装置自动推荐音乐时,通过车载外景图像采集器采集汽车外的风景图片;
11、s203:收到实时图像帧后,调用图像-音乐多模态描述模型,将实时采集的汽车外风景图片转化为图像-音乐多模态描述向量;
12、s204:音乐向量搜索器在音乐向量库中检索与图像-音乐多模态描述向量距离最近的音乐代表向量,选择余弦距离计算输入的图像-音乐多模态描述向量和音乐向量库中的代表向量之间的距离,遍历音乐向量库中的所有音乐代表向量,选取余弦距离最近的音乐代表向量所对应的音乐,作为推荐结果推送给用户。
13、进一步,上述图像-音乐多模态描述模型的产生过程如下:
14、s401、训练数据采集:
15、遍历音乐曲库中的所有音乐,从每一支音乐所在专辑中选取合适的插图作为该支音乐的对应图片,形成音乐-图片描述对;对于音乐曲库中的每一支音乐片段mi,获得与其描述意象相匹配的图像ti,形成音乐-图片描述对(mi,ti);
16、s402、训练数据整理:
17、随机抽取一支音乐mi和与某支音乐匹配的图像ti,当i等于j时作为正样本(mi,ti,0),当i不等于j时,作为负样本(mi,tj,1);依据上述方式,对原始训练数据进行增强,形成正式训练数据集;
18、s403、模型训练:
19、图像-音乐多模态描述模型包括图像编码器分支和音乐编码器分支;
20、将正式训练数据集中的正负样本分批次依次输入至图像-音乐多模态描述模型,图像-音乐多模态描述模型基于transformer模型对输入的正负样本进行训练,具体为:
21、当输入一个正样本时,音乐片段mi经过音乐编码器分支编码为1024维特征向量,图像ti经过图像编码器分支编码为1024维特征向量,两个特征向量计算余弦距离作为模型预测值,监督类标签为0;
22、当输入一个负样本时,音乐片段mi经过音乐编码器分支编码为1024维特征向量,而图像tj经过图像编码器分支编码为1024维特征向量,两个特征向量计算余弦距离作为模型预测值,监督类标签为1;
23、然后采用交叉熵损失函数来度量模型预测值和监督类标签之间的误差,并将该误差回传来更新transformer神经网络结构。
24、进一步,当模型预测值越接近0时,音乐片段的描述向量和图像的描述向量的余弦距离越小,音乐片段和图像匹配的概率越高;当模型预测值越接近1时,音乐片段的描述向量和图像的描述向量的余弦距离越大,音乐片段和图像不匹配的概率越高。
25、进一步,在步骤s401中,对于专辑封面、插图中无法找到精准的与音乐匹配的图片的情况,人工选择合适的图片形成音乐-图片描述对。
26、进一步,在步骤s403中,图像编码器分支采用vit模型对输入的图像进行编码描述。
27、进一步,在步骤s403中,音乐编码器分支采用bpe算法对输入的音乐片段进行文本token化,然后采用transformer神经网络结构对token化后的音乐片段进行编码描述。
28、进一步,在步骤s201中,选择音乐开始的20s旋律作为代表旋律片段。
29、进一步,在步骤s202中,车载外景图像采集器通过车载相机采集汽车外的风景图片;当车载相机为全景相机时,截取车前向或车左侧或车右侧120度视野内的图片作为图像采集结果。
30、本发明由于采用了上述技术方案,具有以下有益效果:
31、1、本发明利用大量的音乐专辑中的封面、插图和音乐内容之间的良好对应性,构建了图像-音乐的多模态训练数据;通过模型训练,使得图像-音乐的多模态训练数据内的信息能够被良好地封装为图像-音乐多模态描述模型。
32、2、本发明能够在尽量少的用户交互条件下,实现了根据即时的车外风景向用户推荐与风景意象相匹配的音乐,解决了现有音乐推荐算法在智能车载音乐推荐中无法随时随地根据外部视觉风景推荐合适的音乐的缺陷。
33、3、本发明通过车载外景图像采集器采集实时的车外风景图像数据,通过调用图像-音乐多模态描述模型,将数据转化为图像-音乐多模态描述向量,根据得到的图像-音乐多模态描述向量通过检索匹配得到推荐的音乐,不同于现有技术在获取驾驶场景方面,通常是获取环境信息,如地理位置、车速和声音等,通过这些获取的数据和音乐库中的音乐标签进行匹配,从而匹配得到推荐的音乐。
34、4、本发明不要求采集用户对音乐的评论或点赞等信息,不要求收集用户信息,不涉及任何用户隐私数据的使用。
35、5、本发明能够在车载环境下将车外视觉风景和车内音乐形成良好的对应,实现了车载环境下视觉和听觉的融合体验。
1.一种基于多模态神经网络模型的车载音乐推荐装置,其特征在于,包括:
2.根据权利要求1所述的一种基于多模态神经网络模型的车载音乐推荐装置,其特征在于:所述图像-音乐多模态描述模型包括图像编码器分支和音乐编码器分支,所述图像编码器分支用于采用transformer神经网络结构对输入的图像进行编码描述,所述音乐编码器分支用于采用transformer神经网络结构对输入的音乐代表旋律片段进行编码描述。
3.一种基于多模态神经网络模型的车载音乐推荐方法,其特征在于,包括如下步骤:
4.根据权利要求3所述的一种基于多模态神经网络模型的车载音乐推荐方法,其特征在于:上述图像-音乐多模态描述模型的产生过程如下:
5.根据权利要求4所述的一种基于多模态神经网络模型的车载音乐推荐方法,其特征在于:当模型预测值越接近0时,音乐片段的描述向量和图像的描述向量的余弦距离越小,音乐片段和图像匹配的概率越高;当模型预测值越接近1时,音乐片段的描述向量和图像的描述向量的余弦距离越大,音乐片段和图像不匹配的概率越高。
6.根据权利要求4所述的一种基于多模态神经网络模型的车载音乐推荐方法,其特征在于:在步骤s401中,对于专辑封面、插图中无法找到精准的与音乐匹配的图片的情况,人工选择合适的图片形成音乐-图片描述对。
7.根据权利要求4所述的一种基于多模态神经网络模型的车载音乐推荐装置,其特征在于:在步骤s403中,图像编码器分支采用vit模型对输入的图像进行编码描述。
8.根据权利要求4所述的一种基于多模态神经网络模型的车载音乐推荐装置,其特征在于:在步骤s403中,音乐编码器分支采用bpe算法对输入的音乐片段进行文本token化,然后采用transformer神经网络结构对token化后的音乐片段进行编码描述。
9.根据权利要求3所述的一种基于多模态神经网络模型的车载音乐推荐方法,其特征在于:在步骤s201中,选择音乐开始的20s旋律作为代表旋律片段。
10.根据权利要求3所述的一种基于多模态神经网络模型的车载音乐推荐方法,其特征在于:在步骤s202中,车载外景图像采集器通过车载相机采集汽车外的风景图片;当车载相机为全景相机时,截取车前向或车左侧或车右侧120度视野内的图片作为图像采集结果。
