微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 AI语音识别的"幻觉"难题:北京科技大学等联合团队找到了一把神奇的"方向盘"

AI语音识别的"幻觉"难题:北京科技大学等联合团队找到了一把神奇的"方向盘"

2026-06-16 09:48
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-16 09:48 科技行者

这项由人工智能基础与算法实验室、北京科技大学(MISIS)及俄罗斯国家研究型大学高等经济学院联合开展的研究,以预印本形式发表于2026年6月,论文编号为arXiv:2606.07473,有兴趣深入了解的读者可通过该编号查阅完整论文。

当你用语音助手说话时,背后那个把声音变成文字的系统,就是自动语音识别(ASR)模型。在所有这类模型中,有一个名叫Whisper的家伙格外出名——它由OpenAI训练,学习了多达68万小时的网络音频数据,能够识别几十种语言,堪称语音识别界的"全能选手"。然而,正是因为训练数据来源于网络,Whisper有一个让人头疼的毛病:当你播放一段纯噪音、环境音、或者背景音乐时,它有时候不会老实说"这里没有语音",而是煞有介事地生成一段流畅的文字——这些文字跟音频内容毫无关系,完全是凭空捏造出来的。这种现象,研究者称之为"幻觉"。

幻觉问题在语音识别领域其实相当棘手。你可以把它理解为:一个速记员,本来应该记录会议内容,但当会场突然安静下来、只剩空调的嗡嗡声时,他并没有停笔,而是开始在会议记录本上写下一段根本没人说过的话。更麻烦的是,这些捏造出来的文字往往措辞流畅、逻辑通顺,一眼看去毫无破绽,这让自动检测变得极其困难。

面对这个问题,研究团队提出了一个颇具创意的思路:既然幻觉是从模型内部"生长"出来的,能不能直接深入模型内部,找到导致幻觉的"神经根源",然后在问题发生之前就把它掐灭?正是沿着这条思路,他们开展了一系列深入实验,最终提出了两种无需修改模型参数的"方向盘"式干预方法,并取得了相当出色的效果。

一、幻觉究竟是怎么产生的,Whisper自己的"预警系统"又为何失灵

要理解这项研究解决的问题,得先明白Whisper自身是怎么应对幻觉的。Whisper在工作时会计算两个内部指标:一个叫做"无语音概率",顾名思义就是模型觉得当前这段音频里没有人说话的概率;另一个叫做"平均对数概率",可以理解为模型对自己生成的文字有多大的把握。按照原始设计,当"无语音概率"高于某个阈值,同时"平均对数概率"低于另一个阈值时,模型就会判断这段音频是非语音,从而压制输出,不生成转录文字。

然而,真实情况下这套预警系统常常形同虚设。很多时候,Whisper在面对纯噪音时会以极高的"自信心"生成幻觉文字——它的"平均对数概率"居然很高,仿佛它对自己捏造的内容深信不疑;与此同时,"无语音概率"却出乎意料地低,没有触发报警。换句话说,这个模型在产生幻觉时,完全没有意识到自己正在说谎,甚至觉得自己说得很好。这种"自信的幻觉"正是问题的核心难点所在。

研究团队收集了大量非语音数据来量化这个问题的严重程度。他们在训练集中使用了三类数据:MUSAN噪音数据集、WHAM!环境噪音训练集,以及FSD50k通用声音数据集的开发子集。在测试时,他们又引入了UrbanSound8K城市环境声音数据集、WHAM!的验证和测试子集,以及FSD50k的评估子集。为了排除可能混入的类语音内容,他们还专门定义了FSD50k的"过滤版本",去掉了所有带有"语音"、"音乐"或"人声"标签的样本。所有这些数据合并后形成了"FULL"数据集,训练集共约61896个样本,测试集约26963个样本。

统计结果相当触目惊心。对于Whisper small这个较小版本,整个测试集上的幻觉率高达72.63%;而对于Whisper large-v3这个更大更强的版本,幻觉率更是飙升到了86.88%。换句话说,当你把一段非语音音频交给Whisper large-v3处理时,超过八成的概率它会煞有介事地生成一段莫须有的文字。

二、深入模型内部:幻觉的"指纹"藏在哪里

找到问题的严重性之后,研究团队开始像侦探一样,深入Whisper的内部结构,寻找幻觉留下的蛛丝马迹。Whisper的音频编码器由多个Transformer层叠加而成,每一层都会对输入的音频特征进行加工和变换,最终产生一系列"隐藏表示"——可以把这些隐藏表示理解为模型在不同加工阶段对音频所形成的"理解草稿"。

研究团队从每一层提取了这些隐藏状态,然后用时间维度上的平均值将其压缩成一个固定大小的向量,以便后续分析。接着,他们在这些向量上训练了一个最简单的线性分类器——逻辑回归,来判断一段音频是否会导致幻觉。之所以选择线性分类器,是有深意的:如果一个简单的线性分类器就能把幻觉样本和正常样本区分开来,那说明两类样本在这个空间里是"线性可分"的,存在一条清晰的分界线。而只有存在这样的分界线,后续的"方向盘"式干预才能有效工作。

实验结果证实了这个猜想。无论是Whisper small还是large-v3,线性分类器在不同层的激活值上都能达到远高于随机猜测的分类性能。更重要的是,有一个规律贯穿所有实验:分类性能随着层深度的增加而稳步提升,越靠近编码器末尾的层,区分幻觉与非幻觉样本的能力就越强。这就好比一个人在做决定之前,脑子里的想法会越来越成熟、越来越清晰——Whisper的编码器在最后几层已经对"这是不是非语音内容"有了相当明确的判断,只是这个判断没有被后续的解码器正确地利用起来。

三、稀疏自动编码器:把混乱的内部语言翻译成清晰的"语义词典"

原始的激活向量虽然包含了可分离的幻觉信息,但它有一个根本性的局限:每个维度都混杂了多种含义,很难说某个具体的数值变化代表什么。这就好比一锅乱炖,各种味道混在一起,你很难说清楚哪种味道是辣椒带来的,哪种是花椒贡献的。

为了解决这个问题,研究团队引入了稀疏自动编码器(SAE)。SAE的核心思想是:把这锅乱炖"分解"成一份清晰的食材清单。具体来说,SAE是一种特殊的神经网络,它能够把原始的激活向量(比如768维或1280维)投射到一个更高维度的空间(分别是6144维和10240维),同时强制要求在这个高维空间里,绝大多数维度的值为零,只有少数维度是激活的。这种"稀疏性"的约束让每个激活维度趋向于只代表一个单一的概念,从而把原本混乱的"乱炖"分解成了清晰的"食材清单"。

研究团队使用了之前工作(AudioSAE)中训练好的稀疏自动编码器检查点,这些SAE在Whisper编码器的每一层都有对应的版本,使用"批量Top-k"架构,每次只允许恰好50个维度同时激活。将这些SAE应用于音频样本后,研究团队得到了一组高维的稀疏表示,然后同样在上面训练线性分类器。

结果同样令人振奋:SAE表示上的分类性能与原始激活值相当,在某些数据集上甚至略有超越。特别是对于Whisper large-v3,SAE表示在FULL测试集上达到了0.80的AUC分数,略高于原始激活的0.77。更关键的发现来自于一个额外的实验:研究团队测试了用不同数量的"最重要特征"来做分类,看看多少个SAE维度就足够了。结果表明,仅仅使用50到100个最具区分性的SAE特征,分类性能就基本达到饱和,继续增加特征数量几乎没有额外收益。这意味着幻觉相关的信息在SAE空间里高度集中,只需要一小撮关键"食材"就能判断这锅汤的味道。

四、两种"方向盘":如何在不改装引擎的情况下改变行驶方向

有了上述发现,研究团队开始着手设计实际的干预机制。他们的核心思路是"激活引导"——在模型推理时,直接修改某一层的内部表示,把它往"远离幻觉"的方向推一推。关键在于,这种干预完全不需要修改模型的任何权重参数,就像不需要给汽车换发动机,只需要转动方向盘一样轻巧。

第一种方法是在原始激活空间里直接操作。研究团队先分别计算出所有幻觉样本在某一层的平均激活向量和所有正常样本的平均激活向量,然后用正常样本的均值减去幻觉样本的均值,得到一个"方向向量"。这个向量指向的方向,就是从"幻觉区域"走向"正常区域"的方向。在推理时,每当处理一段新的音频,就把这个方向向量乘以一个缩放系数,然后加到对应层的激活值上。对于Whisper small,最优的缩放系数是8;对于Whisper large-v3,则是2。

第二种方法更为精细,它在SAE的稀疏表示空间里操作。具体流程是这样的:首先用逻辑回归分类器找出哪些SAE维度对幻觉预测贡献最大,也就是确定哪些"食材"是导致幻觉的关键因素。然后,根据这些关键维度的贡献方向,构建一个稀疏的"引导向量":对于那些正向促进幻觉的维度,就把它们往反方向拨;对于那些负向抑制幻觉的维度,就把它们往正方向推。完成这个操作后,再通过SAE的解码器把修改后的稀疏表示重新转换回原始激活空间,注入到编码器的残差流中。

在SAE引导的具体实现上,研究团队比较了两种策略:加法式和乘法式。加法式是在目标维度上直接加上或减去一个偏移量,这个偏移量的大小与该维度在参考数据集上的平均激活幅度成正比,避免对本来激活幅度很小的维度造成过大的扰动。乘法式则是对目标维度的激活值进行等比例缩放,放大有益维度、缩小有害维度。实验发现,加法式在较小的top-k值下表现更好,这是因为许多SAE特征对于特定输入样本本身就是零(未激活),乘法操作对零值无能为力,而加法操作即使对未激活的维度也能施加影响。因此,研究团队最终选择加法式SAE引导作为主要方法。

超参数的选择方面,对于Whisper small,最优配置是使用25个最重要的SAE特征,缩放系数为3;对于Whisper large-v3,则是10个特征、缩放系数为5。所有超参数都只在训练集上调整,测试集完全不参与调参,确保结果的公正性。

五、实验结果:幻觉率大幅下降,语音识别基本保住

研究团队在多个测试集上系统评估了两种方法的效果,同时密切监控语音识别质量(英文用词错误率WER衡量,中文用字错误率CER衡量),确保在压制幻觉的同时不会把正常语音识别也搞坏。

对于Whisper small,原始模型在FULL测试集上的幻觉率为72.63%。经过SAE加法式引导(在第12层干预,top-k=25,α=3)之后,幻觉率下降到了14.11%——降幅接近80%。在具体数据集上,UrbanSound8K的幻觉率从67.09%降至8.68%,WHAM!从66.93%降至4.68%,FSD50k从81.95%降至26.12%。与此同时,英文语音识别的词错误率从基准的3.50%(LibriSpeech clean)小幅变化,总体保持在可接受范围内。

对于Whisper large-v3,原始模型的幻觉率高达86.88%。通过在第26层和第32层依次施加SAE引导(top-k=10,α=3.5),幻觉率降至27.33%。在UrbanSound8K上,幻觉率从95.98%降至19.88%;在WHAM!上从92.04%降至27.05%;在FSD50k上从75.08%降至33.92%。英文词错误率在clean测试集上仅从2.11%升至3.70%,在other测试集上从4.02%升至7.58%,代价相对温和。

相比之下,原始激活空间的引导效果就逊色很多。对于Whisper large-v3,在第32层施加激活引导后,幻觉率仅从86.88%降至82.37%,改善十分有限,而词错误率却从2.11%跳升至4.11%。这说明SAE稀疏表示提供的"精准手术"远比在原始激活空间里的"大刀阔斧"有效。

有一个值得特别说明的现象是关于中文识别的问题。两种引导方法都导致中文字错误率(CER)有较大幅度的上升,而且即便不施加任何引导,仅仅把音频通过SAE进行编解码,中文CER就已经明显变差。研究团队分析原因在于:用于训练SAE的AudioSAE数据集主要包含英文和其他语言的语音,中文普通话数据量很少,属于SAE的"领域外"数据。当SAE处理中文语音时,其稀疏表示的质量较差,重建误差较大,因而干扰了中文识别所依赖的细节特征。这也成为后续研究需要解决的重要问题之一。

六、与已有方法的对比:接近微调效果,无需动模型一根毫毛

研究团队还将结果与一个名为"Calm-Whisper"的已有方法进行了比较。Calm-Whisper采用了一种完全不同的策略:它先通过实验找出Whisper large-v3解码器中少数几个"爱捣乱"的自注意力头,然后对这些头进行专项干预,甚至可以通过微调来彻底纠正它们的行为。Calm-Whisper的微调版本在UrbanSound8K上实现了15.51%的幻觉率,同时保持了接近基准的词错误率(clean为2.19%,other为4.13%)。

与之对比,本文的SAE引导方法(在第26层和第32层同时干预)实现了19.88%的幻觉率,词错误率分别为3.70%和7.58%。虽然幻觉率略高于微调版的Calm-Whisper,但与其"零参数更新"的不微调版本(幻觉率24.10%)相比,SAE引导已经略胜一筹。更重要的是,本文的方法完全不需要修改模型任何权重,实施成本极低,可以在任何已部署的Whisper实例上直接应用。

此外,两种方法的干预位置也不同:Calm-Whisper作用于解码器,而本文的方法作用于编码器。这一差异背后隐藏着一个有趣的理论发现:幻觉不仅仅是解码器层面的生成问题,在编码器阶段就已经埋下了祸根。换句话说,当Whisper面对一段纯噪音时,它的"理解草稿"在编码阶段就已经走偏了,后续的解码器只是把这个走偏的理解转化成了文字输出。

归根结底,这项研究揭示了一个相当深刻的道理:AI模型的"说谎"行为,其实在它内部处理信息的早期阶段就已经有迹可循,只是我们之前没有合适的工具去发现和干预。稀疏自动编码器恰好提供了这样一种工具——它把模型内部混沌的"内心独白"翻译成了一份相对清晰的"特征词典",让研究者得以精确定位并纠正那些导致幻觉的关键信号。

当然,这项工作也留下了明显的待解问题。中文等非主流语言的SAE表示质量不足,意味着当前方案的跨语言泛化能力有限;多语言SAE的训练将是未来的重要方向。此外,研究团队目前只在单层或相邻两层施加干预,多层协同引导的策略尚待探索。对于大规模工业部署而言,如何在不影响推理速度的前提下集成这套机制,也是值得认真考虑的工程问题。

这项研究留给我们的核心启示是:有时候,修复一个系统的问题,不一定需要对它进行大规模的改造,找准那根关键的"弦",轻轻拨动它,就已经足够改变整个音调。有兴趣深入了解技术细节的读者,可以通过论文编号arXiv:2606.07473查阅完整原文。

Q&A

Q1:Whisper语音识别模型的幻觉问题具体是什么表现?

A:Whisper在处理纯噪音、环境音、背景音乐等非语音音频时,不会识别为"无语音内容",而是自动生成一段流畅但完全捏造的文字转录。这些幻觉文字与输入音频毫无关联,且模型自身对这些内容表现出很高的"自信心",导致其内部过滤机制也无法有效拦截,在测试中幻觉率可高达86.88%。

Q2:稀疏自动编码器(SAE)在幻觉检测中起到什么作用?

A:SAE把Whisper编码器产生的密集、混杂的激活向量分解成一个高维稀疏表示,使得每个维度趋向于只代表一个单一概念。研究发现,只需要50到100个最关键的SAE特征就能区分幻觉与非幻觉样本,说明幻觉信息在SAE空间里高度集中。这种清晰的特征分布为后续的精准干预提供了基础。

Q3:SAE引导方法为什么不会严重损害正常语音的识别质量?

A:SAE引导只修改少量(10到25个)最关键的稀疏特征维度,对其余绝大多数维度不做任何改动,属于"精准手术"而非大范围扰动。实验表明,对于英文语音,词错误率的变化幅度相对温和。但对中文等SAE训练数据覆盖不足的语言,字错误率会明显上升,说明SAE本身的语言覆盖范围是影响质量保持能力的关键因素。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-