
这项由上海交通大学人工智能研究院、浙江大学及上海人工智能实验室联合开展的研究,以预印本形式于2026年4月14日发布于arXiv平台,论文编号为arXiv:2604.13023v1,研究方向归属于计算机科学与声音处理领域(cs.SD)。
当你把一段长达一分钟的城市环境录音发给一个AI助手,然后问它:"狗叫声是从第几秒到第几秒?",会发生什么?大多数现有的AI会给你一个模糊的回答,要么说"有狗叫",要么随机给你一个根本不准确的时间段。这就像你让一位朋友在一首交响乐中帮你找出小提琴独奏的具体时刻,结果他只告诉你"这首曲子里有小提琴"——答案是对的,但完全没用。
这个看似简单的问题,背后其实藏着当前语音AI领域一个相当棘手的困境。研究团队将这种能力称为"时序定位"——也就是不仅要听懂声音是什么,还要知道它精确地出现在哪个时间段。正是为了解决这个问题,研究团队开发了一套名为SpotSound的系统,并配套推出了一个专门用于测试这类能力的评测基准SpotSound-Bench。
一、为什么现在的AI"听得见却说不清"
要理解这个问题,可以先把现有的大型音频语言模型想象成一个厨师学徒。这个学徒经过了大量的厨艺培训,能准确辨认出菜肴里放了什么食材——盐、糖、花椒、八角,一一说得出来。但如果你问他:"厨师是在第几分钟把花椒加进去的?"他就傻眼了,因为他的训练从来都是对着整道菜打分,而不是盯着锅边记录每一步操作的时间节点。
现有音频AI系统面临的处境与此如出一辙。绝大多数大型音频语言模型在训练时使用的数据都是"片段级标注",也就是说,训练材料只会告诉模型"这段30秒的录音里有狗叫声",而不会精确标出"狗叫发生在第8.3秒到第11.7秒之间"。久而久之,模型学会了识别声音类型,却完全没有学会把声音与具体时间绑定。
更糟糕的是,现有的评测基准也存在严重的"作弊空间"。研究团队分析了几个主流测试数据集后发现,这些数据集里目标声音事件的时长平均占整段录音的26%到33%。换句话说,如果模型随机猜一个时间段,猜中的概率已经相当高了,这根本无法反映真实场景的难度。现实中的音频往往是这样的:一段嘈杂的街道录音里,偶尔闯入一声短暂的犬吠,整个事件可能只占几秒钟,被淹没在汽车鸣笛、人声嘈杂的背景噪声里。这才是真正的挑战。
正是为了弥补训练数据和评测两方面的不足,研究团队系统性地设计了SpotSound的整套解决方案。
二、把时间"嵌入"声音流:时间戳交错序列的工作原理
SpotSound的核心创新之一,是一种被研究团队称为"时间戳交错序列"的音频表示方式。要理解这个概念,可以借用一个阅卷老师批作文的场景来类比。
通常情况下,AI处理音频的方式就像批改一篇没有段落编号的作文——老师只能感知整体内容,无法精确定位某句话出现在第几段。而SpotSound的做法,相当于把这篇作文重新整理成了这样的格式:"第1段(第1秒至第2秒):……具体内容……第2段(第2秒至第3秒):……具体内容……",每一个时间段的音频特征前面都明确标注了对应的时间戳。
具体来说,对于每一秒的音频内容,系统会先生成一个文本标签,格式为"时间戳:X秒",然后把这个文本标签和对应的音频特征紧密拼在一起,最终形成一条长长的交错序列:[第1秒标签, 第1秒音频特征, 第2秒标签, 第2秒音频特征, ……]。这条序列连同用户的问题一起送入大型语言模型进行分析。
这样做的妙处在于,语言模型本就擅长处理文本,而文本中嵌入的时间戳信息相当于给模型提供了一张精确的"时间地图"。当模型想要输出"狗叫声出现的时间段"时,它只需要从这张地图上"读出"相关的时间坐标即可,而不需要从复杂的数值编码中反推时间信息。研究团队选择以1秒为粒度插入时间戳,这个设置在精度和计算效率之间取得了较好的平衡——后续的消融实验也验证了这一点。
在底层架构上,SpotSound采用了两种大型音频语言模型作为骨干网络:Qwen2-Audio和Audio Flamingo 3,对应地产生了两个版本,分别叫做SpotSound-Q和SpotSound-A。两者都使用Whisper-large-v3作为音频编码器,先把原始音频转换为梅尔频谱图,再通过编码器压缩成特征向量——编码器的输出中,每个时间步大约对应40毫秒的原始音频。对于超过30秒的长录音,系统会把音频分割成连续的30秒片段分别编码,然后按时间顺序拼接成统一的特征序列。
三、让AI学会说"没有":对抗幻觉的训练设计
语言AI有一个几乎是天生的毛病,叫做"幻觉"——它们倾向于给出听起来合理的答案,哪怕问题根本没有正确答案。放到音频时序定位任务里,这个问题的表现就是:哪怕录音里根本没有钢琴声,只要你问"钢琴声在哪段",某些AI就会一本正经地告诉你"从第5秒到第12秒"。
这种行为在安防监控或媒体取证等实际场景中可能导致严重后果。为了系统性地解决这个问题,研究团队为每一条训练样本都配上了一个"反例查询"。具体操作是这样的:对于某段录音(比如包含狗叫声的录音),研究团队会同时准备两种问题。第一种是正向查询:这段录音里有没有狗叫声?有的话,它出现在哪个时间段?第二种是负向查询:这段录音里有没有钢琴演奏?模型应该学会回答"没有",而不是凭空捏造一个时间段。
负向查询的选取也很讲究:从全体训练数据的查询集合中抽取,但需同时满足两个条件——第一,被抽取的声音事件确实不存在于当前录音中;第二,被抽取的描述与正向查询在措辞上没有词汇重叠,避免模型通过字面相似性来偷懒作答。通过这种"正反配对"的训练方式,模型被强制学会了一项基础能力:在作答之前,先核实声音证据是否真的存在于录音中。
四、造一个更难的考场:SpotSound-Bench的设计逻辑
现有的音频时序定位测试集有个共同的软肋——目标声音在录音中占的比例太高,找起来太容易了。研究团队把这个问题用一个形象的比喻概括为"大海捞针"——而现有的考场更像是"水杯里捞针"。
为了构建一个真正贴近现实的评测环境,研究团队从YouTube上收集了一批真实的长篇录音,以UnAV-100数据集的100个声音类别为指引进行标注,专门关注那些短暂出现的声音事件。最终形成的SpotSound-Bench包含300组"录音-查询-时间戳"三元组,平均每段录音时长约53.4秒,而目标声音事件平均只有4.5秒,时间密度仅为8.4%。
这意味着,在超过90%的时间里,录音中播放的都是与目标声音无关的背景内容。模型必须在茫茫的背景噪声中精确捕捉到那一小段闪现的目标声音,才能给出正确答案。与之形成对比的是,另外三个主流测试集中目标声音的时间占比分别为26%(AudioGrounding)、33%(Clotho-Moment)和28%(UnAV-100 subset),差距相当悬殊。
五、用来训练模型的声音数据是怎么做出来的
除了借用现有数据集,研究团队还自行生成了一批专门用于时序定位训练的合成数据,总量达到1万条。制作过程可以类比为录制一张混音专辑:先准备好"前景音轨"和"背景音轨",再按照设计好的时间表把它们叠加在一起。
前景音轨来自两个数据源。一部分来自AudioSet的强标签子集,这些录音自带精确到秒的事件标注,研究团队用DeepSeek-v3这个大型语言模型把结构化的标签和时间信息转化为自然语言描述,比如把"0-3秒:狗叫;4-7秒:汽车鸣笛"转化为"录音开始时一只狗在叫,随后一辆汽车按响了喇叭"这样的描述。另一部分来自VGGSound数据集,研究团队用Qwen2-Audio直接听录音并生成音频描述,经过抽样验证,生成描述的准确率超过95%。
为了让前景声音更干净,研究团队还对录音进行了裁剪处理:对于AudioSet的样本,把所有声音事件的时间区间合并成一个连续的段落,去掉首尾的无效部分;对于VGGSound的样本,则去掉音量低于平均值20分贝以上的静音段落,保留有效的音频内容。
背景音轨则来自"Walking Tours"这个数据集,每段背景录音长40到60秒,内容主要是各种自然环境和街道的环境声。制作合成数据时,研究团队把裁剪好的前景音轨随机插入到背景音轨的某个位置,插入位置的时间戳就成为了训练标签中的"答案"。混音时还加入了随机的音量抖动——前景声音的音量会在标准值上下5分贝范围内随机波动,背景声音则保持在比前景低10分贝左右,整体波动范围也是±5分贝,从而模拟现实中多变的信噪比条件。
整个训练语料库最终汇总了77,600组音频查询对,融合了AudioGrounding、Clotho-Moment、UnAV-100、AudioSet强标签子集和自行合成的数据五个来源,覆盖了从10秒短片到60秒长录音的不同时长,以及自由描述型和固定标签型两种查询格式。
六、比赛结果:SpotSound在几项关键测试中表现如何
研究团队把SpotSound与一批竞争对手放在同一个考场里进行了全面比较,参赛选手包括两类:一类是专门为时序定位任务设计的专项模型(WTATG和AM-DETR),另一类是近期表现较强的通用大型音频语言模型(Kimi-Audio、TimeAudio、Qwen2-Audio、Audio Flamingo 3,以及谷歌的Gemini-2.5-Flash和Gemini-2.5-Pro)。评测指标主要有两个:mIoU(平均交并比,衡量预测时间段与真实时间段的重叠程度)和R1@.5(衡量预测时间段与真实时间段的重叠率超过50%的比例)。
结果呈现出几个鲜明的规律。专项模型的问题是"术业有专攻,却不能跨界":WTATG在自己的训练测试集AudioGrounding上能拿到51.4的mIoU,但一旦放到Clotho-Moment这个不同分布的数据集上,成绩骤降至9.1,几乎崩盘。AM-DETR在Clotho-Moment上表现出色(mIoU 80.9),但在短窗口定位更难的SpotSound-Bench上只有22.5。
通用大型音频语言模型的问题是"听得懂声音,说不清时间":Kimi-Audio在所有四个测试集上的mIoU都徘徊在10以下,Qwen2-Audio也类似。即便是连续两版排名靠前的Gemini-2.5-Flash和Gemini-2.5-Pro,mIoU也始终低于40,说明这类能力并非仅仅靠参数量堆砌就能获得。Audio Flamingo 3在SpotSound-Bench上的mIoU只有9.1,暴露出对复杂背景场景的明显弱点。
SpotSound-A(基于Audio Flamingo 3的版本)在四个测试集上分别取得了85.6、69.8、52.7和70.3的mIoU,在Clotho-Moment上超越此前最强方法4.7个百分点,在UnAV-100 subset上领先27.0个百分点,在SpotSound-Bench上领先幅度高达20.4个百分点,在AudioGrounding上也领先2.9个百分点。SpotSound-Q(基于Qwen2-Audio的版本)同样表现强劲,在多项指标上达到最佳或次佳水平。
定性分析同样揭示了各模型的典型失败模式。面对一段关于"演奏班卓琴"的查询,真实答案是27到34秒,SpotSound-A给出了27秒到34.7秒的预测,几乎完美;而Qwen2-Audio给出了0到12.4秒,语法完整但语义错位;Kimi-Audio直接给出了0到29.8秒,相当于把整段录音都标记为答案;TimeAudio给出了0.1到27.2秒;Audio Flamingo 3则陷入了逐帧幻觉的循环,输出了大量碎片化的无效时间段。
七、抗幻觉能力测试:AI能分辨"根本没有"吗
研究团队专门设计了一轮针对幻觉问题的测试。每段录音配上一个正向查询(录音里真实存在的声音)和一个负向查询(录音里根本不存在的声音),然后要求模型判断是否存在。
测试结果相当能说明问题。TimeAudio完全无法完成这项任务——它被设计成总是给出时间段,连"不存在"这个概念都表达不了。Kimi-Audio和Qwen2-Audio在正负样本上的判断准确率都只有五六十个百分点,差不多接近随机猜测的水平。Audio Flamingo 3在部分场景下表现较好,在AudioGrounding的负向查询上能达到76%的准确率,但在长录音的Clotho-Moment上只有70.3%。SpotSound-A在Clotho-Moment上正向和负向查询的准确率都达到了85.4%,在AudioGrounding上正向准确率93.4%、负向准确率87.9%,对幻觉的抑制相当稳健。
研究团队还进行了两阶段联合评估,要求模型先判断声音是否存在,只有判断为"存在"才进入第二阶段的时间定位,最终用F1分数来综合衡量。在这项更严格的综合测试中,TimeAudio的F1分数直接用斜杠标注(无法完成),Kimi-Audio的F1分数在各测试集上基本低于5,Qwen2-Audio在部分较简单的测试集上能达到11。SpotSound-Q在Clotho-Moment上取得了92.0的F1,在SpotSound-Bench上达到69.7,而SpotSound-A在SpotSound-Bench上更是达到了83.8的F1,远超其他所有模型。
八、声音事件检测任务:看看泛化能力如何
为了验证SpotSound在获得时序定位能力的同时没有丢失原有的通用能力,研究团队还在两个经典声音事件检测数据集上进行了测试:TUT Sound Events 2017和DESED。这两个任务的设定与时序定位略有不同,但同样需要模型给出精确的声音事件时间段。
TUT Sound Events 2017包含非常长且复杂的录音,研究团队将其切割为60秒片段进行处理,这对所有模型都是相当大的挑战。在这个数据集上,SpotSound-A取得了30.7的R1@.5和33.2的mIoU,显著优于排名第二的TimeAudio(18.0和22.5)。DESED的录音时长只有10秒,与大多数已有模型的训练分布更贴近,在这个数据集上Qwen2-Audio已经能达到28.2的R1@.5,SpotSound-Q进一步提升到66.6的R1@.5和61.1的mIoU,仍然领先。
这说明SpotSound并不是通过"遗忘旧技能来学习新技能"——它在掌握精细时序定位的同时,整体的声音理解能力也得到了保留甚至提升。
九、细节调优:时间粒度、数据比例和模型参数怎么选
研究团队做了大量的消融实验,仔细考察每一个设计选择对最终性能的影响。
关于时间戳插入的粒度,研究团队对比了0.2秒、1秒和2秒三种设置。实验结果显示,不同的粒度对不同长度的测试集有不同的影响:2秒粒度在长录音的Clotho-Moment上效果略好(mIoU 87.2),而0.2秒粒度在短录音的AudioGrounding上更占优势(mIoU 72.7),但代价是推理速度变慢——0.2秒粒度下每条样本的推理时间从1.0秒增加到1.4秒。综合四个测试集的整体表现和计算效率,研究团队最终选择了1秒作为默认粒度。
关于训练数据的配比,研究团队测试了三种AudioSet强标签数据与合成数据的比例组合:5k配10k、10k配10k、10k配20k。结果显示,5k配10k这个配置在综合性能上最为均衡。AudioSet强标签数据提供了可靠的真实标注,但全部是10秒短片,加入过多会损害长录音场景的表现;而合成数据以50秒长录音为主,加入过多则会损害短录音场景的性能。两者配合的黄金比例正是5k对10k。
关于LoRA微调的参数规模,研究团队测试了秩为8、16、32三种设置(对应的alpha分别为16、32、64)。结果出人意料:参数量最小的r=8、alpha=16配置反而取得了最好的成绩,更大的参数量反而导致性能下降,可能是过拟合所致。
十、鲁棒性测试:如果换个说法问,或者把声音挪到别的位置
研究团队还进行了两类鲁棒性测试,专门检查模型是否真的"理解"了声音,还是只是学会了走捷径。
第一类测试叫做时间位置扰动:把目标声音事件从原来的时间位置剪下来,随机插入到背景录音的另一个位置,然后测试模型还能不能找到它。研究结果显示,在这种扰动下,SpotSound-A的mIoU从55.1下降到51.0,降幅约4个百分点,依然保持了相当高的准确率。这说明模型不是简单地记住了"目标声音通常出现在第几秒"这种统计规律,而是真的通过分析音频内容来定位。
第二类测试叫做查询改写:用DeepSeek-v3把原来的查询词改写成同义表达或疑问句形式,然后测试模型是否仍然能正确定位。比如把"狗叫"改写成"犬类发出的叫声",或者改成"这段录音里有没有狗在吠叫?"。结果显示,同义改写后模型的mIoU几乎没有变化(55.1对55.0),疑问句改写后也只下降了约1.8个百分点(53.3)。这表明模型掌握的是声音概念本身,而非特定词汇的模式匹配。
说到底,SpotSound做的事情,是把"AI能听懂什么声音"这个已经相当成熟的能力,进一步升级成了"AI能说清声音精确出现在哪个时刻"。这个升级看似一小步,但对于需要精确时间信息的实际应用来说,是质的飞跃。
现有的AI在这方面的问题根源有两个:一是训练数据从来没有要求它们关注时间;二是考试题目太简单,随便猜也能及格。SpotSound通过两个核心设计同时解决了这两个问题:时间戳交错序列给了模型一张精确的时间地图,正负样本配对训练让模型学会了在开口之前先确认证据。
当然,这套系统目前也有它的局限。在多次出现的声音事件场景中,模型有时会在找到最显眼的那次之后就停止搜索,遗漏其他出现的时刻。在UnAV-100 subset的评测中,模型过于精细的定位有时反而会因为与粗粒度的标注标准不符而被扣分——这更像是评测标准的问题,而非模型能力的缺陷。在复杂的多声部场景中(多种声音同时出现且相互重叠),模型的表现也还有提升空间。
研究团队已经将代码、模型权重和SpotSound-Bench测试集全部开放,有兴趣深入研究的读者可以通过arXiv编号2604.13023查询完整论文,或前往论文主页进一步了解技术细节。
Q&A
Q1:SpotSound和普通音频识别AI有什么本质区别?
A:普通音频识别AI通常只能告诉你"这段录音里有什么声音",但无法说清楚声音出现在哪个时间段。SpotSound的核心能力是"时序定位"——不仅识别声音类型,还能精确给出起止时间,例如"狗叫出现在第1.0秒到第1.9秒,以及第4.3秒到第5.0秒"。实现这一能力的关键是把时间戳信息直接嵌入音频特征序列,相当于给AI提供了一张随时间展开的声音地图。
Q2:SpotSound-Bench和其他音频测试集有什么不同?
A:现有测试集里,目标声音事件平均占整段录音的26%到33%,模型即使随机猜测也有不低的命中率。SpotSound-Bench专门收集了长达53秒的录音,但目标声音事件平均只有4.5秒,时间密度仅8.4%,超过90%的时间都是背景噪声。这种"大海捞针"的设计更贴近安防监控、媒体取证等实际应用场景,对模型的真实定位能力要求更高。
Q3:SpotSound是怎么避免AI"无中生有"瞎猜时间段的?
A:研究团队为每条训练数据都配了一个"陷阱问题"——询问录音里根本不存在的声音。模型必须学会回答"没有",而不是捏造一个时间段。负向样本的选取有严格限制:既要确保那个声音真的不在录音里,又要保证问题措辞与真实问题没有词汇重叠,避免模型靠字面相似性作弊。经过这种正负配对训练,SpotSound在判断声音是否存在的准确率上大幅领先其他模型。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。