微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 马萨诸塞大学领衔研究:让AI音乐推荐系统真正"听懂"音乐

马萨诸塞大学领衔研究:让AI音乐推荐系统真正"听懂"音乐

2026-06-11 11:33
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-11 11:33 科技行者

这项由马萨诸塞大学阿默斯特分校联合杜比实验室、Adobe研究院以及思科研究院共同完成的研究,于2026年5月以预印本形式发布,论文编号为arXiv:2606.00125。有兴趣深入阅读原文的读者可通过该编号查阅完整论文。

你有没有遇到过这样的情况:明明在音乐平台上听了几百首歌,但推荐系统还是时不时给你推送一些完全不对味的歌曲?这背后有一个根本性的问题:绝大多数音乐推荐系统根本不"懂"音乐本身,它们只知道"你听过什么",却完全不知道"这首歌是什么样的"。这就好像一个帮你推荐餐厅的朋友,他只记得你去过哪些餐厅,但从来没有认真吃过任何一道菜,对菜的口味、食材和烹饪方式一无所知——这样的推荐,能靠谱吗?

来自多所顶尖研究机构的团队注意到了这个问题,并尝试给推荐系统装上一套真正能"感知"音乐内容的感官系统。他们构建了一个多模态音乐推荐框架,让机器不仅能记住你的听歌历史,还能理解每首歌的声音、歌词和音乐学特征,从而做出更有依据的推荐。

一、推荐系统的"感官缺失"问题

当前主流的音乐推荐系统有一个共同的思路:把每首歌当成一个编号,用大量用户的听歌行为来推断你可能喜欢什么。这种方法就像图书馆管理员通过记录借书记录来猜你的口味,而不是真正翻开书来读。这种"协同过滤"方式在用户数量庞大、每首歌都有足够多人听过的情况下表现尚可。但一旦遇到冷门歌曲、新用户,或者你突然想听一种平时很少触碰的风格,系统就会手足无措,因为它根本没有足够的历史行为数据可以参考。

更深层的问题在于,音乐这种东西的魅力是多维度的。你喜欢一首歌,可能是因为它的节拍让你想跳舞,可能是因为歌词恰好说中了你的心情,可能是因为那把吉他的音色让你感到温暖,也可能是因为整首歌散发出一种慵懒的午后氛围。这些感受都是真实存在的,但在传统推荐系统眼里,这些统统不重要,重要的只是你点了"播放"这个动作。

这支研究团队决定改变这种状况。他们的思路是:给每首歌配备三种"感官"——听觉(音频特征)、语义(歌词理解)和知识(音乐学属性),再加上一种行为信号(你实际听了多少),然后把这些信息融合在一起,让推荐系统对歌曲有更立体的认知。

二、建造一个"懂音乐"的数据集

研究的基础是一个叫做LastFM-1K的公开数据集,这是来自大约一千名Last.fm用户的听歌历史记录,包含了用户名、时间戳、艺术家名和歌曲名等信息。经过清洗和筛选之后,研究团队保留了814位听歌记录不少于1000条的用户,以及被至少7个人听过的歌曲,最终得到了一个包含4.21亿次播放记录、295,957首独立歌曲的数据集,时间跨度从2005年到2009年。

为了将这个数据集变成真正"富含内容"的多模态数据集,研究团队进行了大量的数据丰富工作,从这个数据集中挑选出被播放次数最多的50,029首歌曲作为核心歌曲目录,然后给每首歌配上四个维度的额外信息。

第一个维度是音频特征。研究团队通过自动化程序从YouTube等平台下载这些歌曲的音频,然后用五种不同的模型提取声音特征。其中有一种叫做CLAP的模型,它经过了音乐与语言的联合训练,能够理解"听起来像..."这类描述;另一种叫MERT的模型,专门针对音乐的声学特性进行了大规模自监督训练;还有Music2Vec、EnCodec以及传统的MFCC梅尔频率倒谱系数方法。除此之外,他们还通过API接口获取了47,113首歌曲(覆盖率达到94.2%)的结构化音频属性,包括情绪值、能量值和可舞性等指标。

第二个维度是歌词特征。研究团队通过网络爬虫收集了这些歌曲的歌词,然后用五种文本编码模型将歌词转换成数字向量,包括MiniLM、BGE-M3、MPNet、多语言句子编码器以及经典的BERT模型。这套歌词嵌入能捕捉歌曲的语义和情感内容,比如主题、叙事视角和语言结构。

第三个维度是由大型语言模型生成的音乐学元数据,这是整个研究中最有创意的部分之一。研究团队采用了一套叫做MGPHot的音乐学标注框架,这套框架定义了58个音乐属性,涵盖歌词情感、人声特征、和声结构、节奏特点、乐器配置、音响风格和编曲重点七大类别。举几个具体例子:歌词类属性包括愤怒感、悲伤感、快乐感等情绪维度;人声类属性包括音域、音色厚薄、气声程度;节奏类属性包括速度、摇摆感、切分音、可舞性;乐器配置则涵盖架子鼓、电吉他、木吉他、钢琴等多种乐器的使用程度。

对于50,029首歌中的每一首,研究团队通过调用GPT-5的API,仅提供艺术家名和歌曲名,让模型对每个MGPHot属性打一个0到5的分数,0代表完全没有这个特征,5代表这个特征非常突出。为了让模型更准确地使用这套评分标准,他们设计了一个"少样本提示"策略,在每次提问前先展示两个参照样本:西蒙和加芬克尔的《Mrs. Robinson》代表柔和、声学、人声主导的风格,而金属乐队的《Master of Puppets》则代表强烈、电气、重型摇滚风格。这两首歌在主要维度上处于完全相反的两端,为模型提供了整个评分范围的参照点,从而让模型在面对其他歌曲时能够更准确地校准自己的判断。

除了MGPHot框架,研究团队还用大模型从歌词中提取了一套扩展音乐学特征,涉及押韵方式、内部押韵密度、押韵复杂度、重复率、词汇丰富度、粗俗程度、叙事视角(第一人称/第二人称/第三人称)、视角是否发生转换、标题与内容的一致性、流派颠覆程度、幽默或反讽的程度,以及说唱与演唱的比例等。这些特征涵盖了歌词的结构、叙事逻辑和文化语境,是纯音频特征和普通标签无法提供的信息层次。值得一提的是,研究团队用LLaMa3.3-70B、Qwen2.5-7B以及Mistral-Nemo-12B三个模型分别进行评分,取三者共识作为最终结果,以此降低单一模型可能带来的偏差。

第四个维度是收听完成率。传统推荐系统把"听过这首歌"和"把这首歌从头听到尾"当成完全相同的信号,但这显然是不对的。一个人把一首歌听完,和一个人只听了开头十秒就切歌,这两种行为传递的偏好信息是截然不同的。研究团队定义了完成率这个指标:用实际收听时长除以歌曲总时长,得到一个0到1之间的数值,1表示完整听完,接近0则表示很快就跳过了。这个信号能帮助系统区分"真正喜欢"和"只是偶尔经过"。

这个数据集有一个值得关注的多样性特点:其中约27.1%的歌曲是非英语歌曲,涵盖42种语言代码,流派标注涉及81种独特风格,这让它成为研究多语言和跨流派推荐的宝贵资源。研究团队已将这个多模态数据集公开发布,供学术界使用。

三、让推荐系统真正读懂每首歌

有了丰富的多模态数据,接下来的问题是:怎么把这些信息有效地融入推荐系统?研究团队选择了一个叫做E4SRec的框架作为基础。

E4SRec的工作原理可以这样理解:它有两个协同工作的部分。第一个部分是"序列编码器",负责分析你的听歌历史序列,理解你的口味是如何随时间演变的;第二个部分是一个大型语言模型(LLM),负责对候选歌曲进行综合评估和排名。研究团队测试了三种不同的序列编码器:SASRec是一种基于自注意力机制的模型,善于捕捉历史序列中长距离的模式;BERT4Rec借鉴了语言模型的双向理解能力;GRU4Rec则使用递归神经网络来处理序列信息。

为了把多模态信息加入这个框架,研究团队需要解决一个根本问题:音频嵌入是一种数字向量,歌词嵌入是另一种数字向量,音乐学元数据是一组数值,完成率是一个单独的小数,而系统原本使用的歌曲ID嵌入又是另一种向量——这些来自不同渠道、格式各异的信息,如何合并成一个统一的表示?

研究团队测试了四种不同的融合策略。最直接的是拼接法,就像把多张照片并排放在一起,把音频向量、歌词向量和ID向量直接首尾拼接,再通过一个线性变换压缩成统一尺寸。加权求和法则给每种模态分配一个可学习的权重,相当于让系统自己决定"在这首歌上,音频信息比歌词信息更重要还是更不重要",然后把各模态信息按比例混合。交叉注意力法把歌曲ID嵌入当作"查询",把音频和歌词嵌入当作"参考资料",让系统主动去检索"在理解这首歌时,音频提供了什么额外线索"。FiLM(特征级线性调制)则是一种更精妙的方式:内容嵌入不是直接加入,而是生成一组"调节参数",用于对歌曲ID嵌入的每个维度进行缩放和平移,相当于用音乐内容来"调教"原始的协同过滤表示。

完成率的融合方式也颇为讲究。研究团队测试了两种方式:一种是将完成率数值转换成一个嵌入向量,与歌曲表示合并;另一种是将完成率以文字形式写入提示词,告诉语言模型"这个用户之前听这首歌只听了30%就换了",让模型在推理时直接利用这个行为信号。

在LLM骨干方面,研究团队测试了三个不同规模的模型:LLaMa-3-70B是迄今测试中规模最大的,拥有700亿参数;LLaMa-2-13B拥有130亿参数;Qwen2.5-7B-Instruct则是一个70亿参数的指令调优模型。每个LLM骨干都在两种设置下进行评估:零样本设置下LLM的权重完全冻结,不进行任何专门训练,多模态特征直接在推理时注入;微调设置下则使用LoRA技术对LLM进行轻量级的任务适配,LoRA是一种高效微调方法,只更新少量额外参数,而不需要更新整个大模型的所有权重,大幅降低了计算成本。

评估指标采用Recall@K和NDCG@K,K分别取5、10和20。Recall@K衡量的是真正应该被推荐的歌曲是否出现在前K个推荐结果中;NDCG@K则是一个更精细的指标,它关心正确的歌曲不只要出现在前K名,还要尽量排在靠前的位置,排得越前得分越高。

四、实验结果:多模态的力量,以及它的局限

研究团队进行了大量的实验,涵盖所有LLM骨干、所有序列编码器、所有融合策略的组合,在零样本和微调两种设置下分别评估。实验结果揭示了几个重要规律。

在零样本设置下,多模态内容特征确实能够带来一定的提升,但提升的幅度和方向高度依赖于具体的模型组合,并不总是稳定的。以LLaMa-3-70B搭配BERT4Rec为例,加入音频、歌词和元数据特征后,Recall@20从0.089提升到了0.124,NDCG@20从0.033提升到了0.048,这是该配置下零样本结果中提升最大的一个。在这个组合中,加入完成率信号进一步强化了效果,说明行为信号对于BERT4Rec来说是有价值的补充。然而,同样在LLaMa-3-70B的零样本设置下,SASRec的最优配置是只使用音频、歌词和元数据而不加完成率——一旦加入完成率,Recall@20反而从0.119下降到了0.091。这说明完成率这个信号对不同的序列编码器的作用方向是相反的,不能简单地认为"信息越多越好"。

微调之后,情况发生了根本性的变化。LLaMa-2-13B微调后,仅使用歌曲ID嵌入的基线配置下Recall@10就达到了0.323,与零样本下0.061的表现相比,提升幅度达到了430%。更重要的是,微调之后,几乎所有加入内容特征的配置都能在ID-only基线上取得进一步的提升,而不再像零样本那样时好时坏。这意味着音频和歌词特征是真正有用的信号,只是在没有任务适配的情况下,系统还不知道如何利用它们。对于LLaMa-2-13B搭配SASRec,加入音频FiLM融合后Recall@10提升到了0.334;联合音频和歌词的FiLM融合则在Recall@10为0.326、NDCG@10为0.158的情况下取得了综合最优。

Qwen2.5-7B-Instruct微调后同样展现了显著的进步。零样本下Recall@10仅有0.056,微调后ID-only基线就直接跳到了0.268。进一步加入音频拼接特征,Recall@10进一步提升到0.326,NDCG@10从0.128提升到0.155。对于Qwen2.5-7B-Instruct搭配GRU4Rec,加入歌词FiLM融合后Recall@20达到了0.403,是该模型下最高的大K值表现。

论文中特别强调了一个有意思的规律:简单地把所有模态的特征堆在一起,并不总是能带来更好的结果。在元数据实验中,研究团队专门对比了三种来源:Spotify提供的结构化音频属性(包括能量、情绪值等)、MGPHot框架的58个音乐学属性,以及两者的合并。结果发现,单独使用MGPHot得到的Recall@20最高达到0.122、NDCG@10最高达到0.024,而把Spotify和MGPHot的数据合并使用之后,最高Recall@20反而下降到了0.114,NDCG@10下降到了0.022。原因在于,MGPHot的属性是用描述性语言表达的,比如"弦乐合奏"和"切分时值感",这类表述对语言模型来说更容易理解和利用;而Spotify提供的是一堆数值字段,语言模型处理大量数值时反而容易被噪声淹没。这个发现意味着:元数据的质量和表达方式比数量更重要。

研究团队还单独测试了每种音频编码器和歌词编码器的性能。在音频编码器中,EnCodec(一种神经音频编解码器的表示)在大多数指标上表现最好,在Recall@20上达到了0.121,而传统的MFCC方法只有0.086,说明深度学习音频特征比手工设计的声学特征更有效。在歌词编码器中,BERT和BGE-M3在小K值(K≤10)下几乎产生不了任何有效推荐,接近零分,而MPNet在NDCG和MRR指标上表现最稳定,因此被选为后续实验的主要歌词编码器。MiniLM虽然在Recall方面有时表现不错,但排名精度较差。

为了验证LLM生成的MGPHot评分是否可靠,研究团队将生成的评分与原始MGPHot数据集中的人工标注进行了比对,计算了斯皮尔曼等级相关系数和平均绝对误差。结果显示,歌词类属性的相关系数约为0.56,音响风格类为0.53,乐器配置类约为0.50,这些相关性是正的且数值合理,表明LLM生成的评分与人工判断在排序上有相当程度的吻合。表现最弱的是节奏和编曲类属性,相关系数约为0.30,这与直觉相符——仅凭艺术家名和歌曲名来推断节奏的细腻特征,本来就比推断乐器配置或歌词情感要难得多。

还有一个关于LLM规模的发现颇为耐人寻味:在零样本设置下,LLaMa-3-70B(700亿参数)并没有比LLaMa-2-7B(70亿参数)或Qwen2.5-7B(70亿参数)取得一致性的更好表现。三者在18个不同实验配置中的"胜利次数"大体相当,LLaMa-3-70B赢了4次,LLaMa-2-7B赢了9次,Qwen2.5-7B-Instruct赢了5次。这说明在冻结权重的零样本推荐场景中,更大的模型并不自动意味着更好的推荐效果,模型与任务的适配程度比模型规模更重要。

五、这对我们和整个领域意味着什么

回到开头那个餐厅推荐的比喻。这项研究的意义在于,它系统性地验证了"让推荐系统真正理解食物本身"这个方向的可行性,并且诚实地展示了这条路上的障碍。

内容特征在微调之后能够稳定地提升推荐性能,而不是零样本下那种时好时坏的状态,这说明音频和歌词中确实存在可学习的有用信号。将ID-only基线对比最优多模态配置,Recall指标的提升幅度最高达到95%,NDCG提升最高达到79%——这不是微小的边际改进,而是相当显著的跨越。

然而研究团队并没有回避问题。多种模态的"朴素融合"——把所有信息不加甄别地堆在一起——往往适得其反。这提示我们,跨模态信息的对齐和协调是一个真正困难的问题。音频的声学信息和文字的语义信息分属不同的"语言",如何让它们在同一个系统里和谐地配合,还需要更深入的研究。

对于音乐平台的工程师和研究者来说,这个工作提供了一套可以直接借鉴的数据丰富方案和实验框架,以及一个公开发布的多模态基准数据集。对于关心冷启动问题的人而言——也就是新歌或新用户缺乏历史数据时怎么推荐——多模态内容特征本质上是一种不依赖交互历史的表示,具有很大的潜力。对于喜欢音乐的普通用户来说,这项研究预示着未来的音乐推荐系统或许真的能从"你以前听过什么"进化到"你喜欢什么感觉的音乐",这两者之间的差距,正是这支研究团队正在努力弥合的。

归根结底,这项研究做了一件扎实而诚实的事情:在一个严肃的实验框架下,系统性地探索了把音乐的声音、词语和属性融入推荐系统的每一个关键环节,把哪些走得通、哪些走不通都摆在了台面上,为后来的研究者留下了一张相当清晰的探索地图。未来的方向,研究团队也明确指出了:需要更鲁棒的跨模态对齐方法、更大规模的多语言实验,以及专门针对冷启动场景的评估。

---

Q&A

Q1:多模态音乐推荐系统比传统音乐推荐系统好在哪里?

A:传统音乐推荐系统只记录用户听过哪些歌,完全不考虑歌曲本身的内容。多模态音乐推荐系统额外为每首歌配备了音频特征、歌词语义和音乐学属性等信息,让系统能够理解歌曲的声音风格、情感色彩和乐器构成,从而在用户历史数据不足时也能做出更有依据的推荐。实验显示,加入这些内容特征后,Recall指标最高提升了95%。

Q2:完成率信号在音乐推荐中为什么有用?

A:完成率衡量的是用户实际收听时长与歌曲总时长的比值。传统推荐系统把"听了一秒就跳过"和"从头听到尾"当成相同的行为信号,但这两种情况显然代表不同的偏好强度。加入完成率后,系统能够区分"真正喜欢"和"只是偶然经过",不过实验发现完成率对不同序列编码器的影响方向不同,对BERT4Rec有稳定的正向作用,但对SASRec有时反而会降低性能。

Q3:为什么把更多元数据融合在一起反而会让推荐效果变差?

A:实验发现,单独使用MGPHot音乐学属性比把Spotify数据和MGPHot合并使用的效果更好。原因在于MGPHot属性用描述性语言表达(如"弦乐合奏""摇摆感"),大型语言模型更容易理解和利用这类文本信号;而Spotify数据主要是数值字段,大量数值堆叠后反而引入噪声,干扰了模型的判断。这说明元数据的表达方式和质量比数量更重要,简单堆砌信息并不等于提供更多有效信号。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-