微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 AI"幻觉"为何难以根除?谷歌与特拉维夫大学研究团队给出了一个出人意料的解法

AI"幻觉"为何难以根除?谷歌与特拉维夫大学研究团队给出了一个出人意料的解法

2026-05-11 11:37
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-05-11 11:37 科技行者

这项由谷歌研究院(Google Research)与特拉维夫大学(Tel Aviv University)联合开展的研究,以预印本形式于2026年5月2日发布在arXiv平台,编号为arXiv:2605.01428v1,有兴趣深入了解的读者可通过该编号查询完整论文。

每个用过ChatGPT、Gemini或者其他AI助手的人,大概都遇到过这样的尴尬瞬间——你问AI一个问题,它用无比笃定的语气给出了一个听起来完全正确的答案,然而事后你一查,发现那个答案根本就是胡编乱造的。更气人的是,AI并没有丝毫犹豫,它说得比任何人都自信,仿佛它亲眼所见一般。这种现象在AI领域有一个专门的名字:"幻觉"(hallucination)。

这个问题困扰着整个AI行业。各大科技公司和研究机构为此投入了大量资源,试图彻底消灭这种"说假话还一脸理直气壮"的毛病。然而,这篇研究揭示了一个令人深思的现实:目前行业内的主流做法,可能从根本上就走错了方向。研究团队经过系统分析后认为,彻底消灭幻觉这个目标,本质上面临着一个几乎无法绕过的两难困境——而真正的出路,恰恰藏在一个大多数人都没有认真考虑过的方向里。

---

一、AI为何总是"说谎"?问题比你以为的更棘手

先用一个医生的例子来打个底。假设你身边有两个医生:一个医生无论遇到什么病情,都会给出一个清晰果断的诊断,绝不含糊,但他其实经常判断失误;另一个医生遇到把握不大的情况,会坦诚地说"这个我还需要进一步检查,目前我倾向于认为是A,但也有可能是B"。这两位医生,哪个更值得信任?大多数人会选第二个,哪怕他有时候说"我不确定"。

现在的AI助手,基本上都在扮演第一种医生——永远自信满满,即便它其实完全不确定。这就是问题的症结所在。

研究团队把AI对知识的处理分成了两个完全不同的维度。第一个维度是"知识边界"——AI到底知道哪些事情,它的知识库有多广。第二个维度是"边界意识"——AI是否清楚地知道自己的知识在哪里结束,哪些是它真正掌握的,哪些只是它在"感觉"或者"猜测"。

研究团队经过仔细梳理发现,过去几年里AI在事实准确性上取得的进步,几乎全部来自第一个维度——不断向AI喂入更多数据,让它知道更多的事情。然而第二个维度,也就是让AI真正搞清楚自己的知识边界在哪里,几乎没有实质性的进展。

这个区别至关重要。一个知识广博但没有边界意识的AI,就像一个博览群书但完全不知道自己什么时候记错了的人——他的知识越丰富,他说错的时候也越令人难以分辨。

---

二、"彻底消灭幻觉",为什么是一个伪命题

研究团队在这里提出了一个精妙的概念区分,理解这个区分对于看清整个问题至关重要。

在统计和机器学习领域,有两个长得很像但含义截然不同的概念:校准(calibration)和判别力(discrimination)。

校准,用最简单的话来说,就是AI对某类问题的整体自信程度,是否和它在这类问题上的整体正确率相匹配。举个例子:如果AI回答了一百个问题,每次都说"我有60%的把握",那么这一百个答案里,恰好有60个是对的,这就叫完美校准。

判别力则是另一回事:AI是否能够在具体的每一个问题上,准确地感知到"这道题我答对了"还是"这道题我答错了"。这要求AI能在个体层面上区分正确答案和错误答案。

关键在于,校准好,并不意味着判别力强。研究团队举了一个很直观的例子:一个AI对所有问题都给出"60%的把握",而它的整体正确率恰好也是60%,那么从校准角度来说,它是完美的。但这个AI的判别力为零——它无法区分自己答对的那60道题和答错的那40道题,因为它对所有问题的"感觉"完全一样。

现有研究大量证明,现代大语言模型的校准其实还不错。但判别力呢?研究团队梳理了大量文献中的数据,发现各种方法、各种模型在真实知识问答任务上,判别力指标(AUROC,可以理解为AI能在多大程度上用自信程度区分对错)普遍集中在0.70到0.85之间。这听起来不算太差,但问题在于,这个水平远远不够。

研究团队通过模拟计算揭示了一个令人吃惊的数据:如果AI的判别力在这个水平(AUROC约为0.71),同时它的基础错误率是25%,那么要把错误率从25%压到5%,AI必须拒绝回答超过一半的问题——哪怕这些被拒绝的问题里,有超过一半其实是它完全能正确回答的。换句话说,为了消灭40%的错误,你付出的代价是失去超过50%的正确信息。

就算把判别力提升到0.85这个文献里几乎最好的水平,要把错误率压到5%,依然需要放弃28%的正确回答。要让这个代价降到可以忽略不计(不到5%的正确信息损失),需要判别力达到0.95以上——而目前没有任何已知方法能在知识密集型任务上接近这个数字。

研究团队还把这个现象在真实数据上做了可视化。他们分析了各大前沿AI模型在"SimpleQA Verified"这个知识问答基准上的表现,把每个模型的"回答覆盖率"(愿意回答多少问题)和"回答准确率"(回答的问题里有多少是对的)画在一张图上。结果这张图呈现出了一个清晰的故事:绝大多数模型都沿着对角线分布,意思是它们选择了"多答"的策略,覆盖率高但错误率也高;少数选择"少答求精"策略的模型,虽然准确率更高,但这是通过拒绝回答大量问题换来的,代价巨大。而那个理想中的"右上角"区域——既愿意回答大量问题,又保持很高的准确率——完全是空的。没有任何模型能到达那里。这个空白区域,就是研究团队所说的"判别力缺口"。

---

三、理论支撑:幻觉可能是无法避免的结构性问题

研究团队并不是在做主观判断,他们还引用了若干从数学角度证明幻觉存在必然性的理论工作。

有研究利用"停机问题"(一个计算机科学中著名的不可解问题)和对角化论证,证明了没有任何可计算的模型能够在所有情况下验证真相或学会所有真实函数。换句话说,从计算理论的根本层面,全知全能的AI就是不可能的。

另有研究证明,一个校准良好的语言模型,在面对那些真假无法从其他已知事实中推断的问题时,数学上必然会产生幻觉。还有研究建立了一个正式的定理,证明将幻觉率降低到某个临界值以下,必然导致模型输出的多样性急剧减少,最终陷入"模式崩塌"——它只会说少数几种安全的答案,失去了作为语言模型的基本价值。

实际观察到的种种现象也印证了这一点。比如一个令人头疼的发现:那些加入了"深度思考"(extended reasoning)的AI模型,反而在某些任务上产生了更多幻觉,而不是更少。这个看起来很反直觉的现象,其实用判别力缺口可以解释得很好——当模型被训练成"一定要给出答案"的倾向时,它会通过更长的推理过程为错误答案找到看似合理的论据,而不是选择承认自己不确定。训练目标是"有用",结果是"更自信地胡说"。

---

四、重新定义问题:幻觉不是"错误",而是"没有资格说的自信"

研究团队在这里提出了整篇论文最核心的概念转变,也是他们找到出路的关键。

长期以来,"幻觉"在行业里被定义为"错误的输出"。这个定义带来了一个隐含的解法:要消灭幻觉,就要消灭错误。而消灭错误,要么是让AI知道更多(扩展知识边界),要么是让AI在不确定的时候拒绝回答(收紧输出门槛)。这就是那个两难困境的来源:两条路,一条让AI越来越博学但仍然会犯错,另一条让AI越来越沉默但越来越"安全"。

研究团队提出,不妨换一个角度来定义幻觉:**幻觉不是"错误的输出",而是"在没有充分理由时,以确信的语气给出的错误信息"**。

这个区别看起来细微,但影响深远。一个医生说"你得了癌症",如果他其实只是猜的,这是幻觉。但如果他说"从目前的症状来看,有可能是癌症,但我需要进一步检查才能确定",哪怕后来证明他的怀疑方向是对的,他的表达是诚实的、负责任的,不是幻觉。错误不是问题,没有资格却以确信语气表达出来的错误,才是幻觉。

这个重新定义打开了第三条路:既不需要AI什么都知道,也不需要AI什么都不说,而是需要AI**诚实地表达自己的不确定性**。

研究团队把这种能力称为"忠实不确定性"(faithful uncertainty)——AI在语言层面表达的确信程度,应当真实地对应它内部状态的确信程度。简单来说,就是:如果AI对某件事不太确定,它说话的方式也应该体现出这种不确定,而不是无论内心多动摇,对外永远一副胸有成竹的样子。

---

五、"忠实不确定性"到底是什么,为什么它是可以实现的

研究团队在论文中给出了这个概念的精确定义,在这里用更通俗的方式来解释。

AI的"内部不确定性"(intrinsic uncertainty),可以理解为:如果你对同一个问题问AI一百遍,它会给出多少种不同的答案。如果每次都给出相同的答案,说明它内部很确定;如果答案五花八门,说明它内部其实很摇摆不定。这是一个可以被客观测量的指标。

AI的"语言不确定性"(linguistic uncertainty),则是AI用来表达答案时,措辞里体现出的确信程度。"1961年8月4日"和"我好像记得是1961年,但不是很确定",这两种表达方式给读者传达的确信感是完全不同的。

所谓"忠实不确定性",就是要让这两者对齐:当AI内部摇摆不定时,它说出来的话也应该带有适当的犹豫和保留;当AI内部非常笃定时,它才用确定的语气表达。

研究团队特别强调了这个目标在原则上是可以实现的,而且比"彻底消灭错误"这个目标更容易实现。原因很简单:消灭错误需要AI的内部状态和外部世界的真相完全对应,而"忠实不确定性"只需要AI的语言输出和它自己的内部状态对应——这是一个闭环问题,AI不需要知道世界上所有的真相,只需要诚实地报告自己的"感觉"。

从技术角度来说,AI的内部确信程度(用生成某个答案的概率来衡量)是完全可以从模型内部提取出来的,这个信号本来就存在。问题只是现在的训练方式让AI学会了不理睬这个信号,在任何情况下都使用同样自信的语气。

研究团队把这种能力——AI既能感知自己的不确定性,又能根据这种感知调整自己的行为——称为"元认知"(metacognition),借用了心理学和认知科学中的一个概念,意思是"对自己认知的认知",即对自己知道什么、不知道什么有清醒的认识。

---

六、"元认知"带来的不只是诚实,还有真正的可靠实用性

研究团队提出了一个他们称为"可靠实用性"(reliable utility)的概念,来描述忠实不确定性能带来的实际好处。

回到之前的例子:假设AI对一批问题的内部确信程度是60%,而这批问题里确实有60%是它能回答正确的。在"必须消灭幻觉"的框架下,AI面临一个集体决策:为了避免那40%的错误,它必须对整批问题都拒绝回答,结果是那60%的正确答案也跟着消失了。这就是"实用性税"——为了安全而付出的代价。

而在"忠实不确定性"的框架下,AI可以选择回答这批问题,但用适当的语气表达:"我认为答案是X,但我不是很确定,你可以进一步核实。"这样,那60%正确的答案被保留了,以有用的形式传达给用户;那40%错误的答案虽然仍然出现了,但被包裹在了适当的犹豫措辞里,用户知道需要谨慎对待,危害大大降低。这个错误还是存在,但它不再是"幻觉"了——因为它被诚实地标记为了"不确定的猜测",而不是"确定的事实"。

研究团队用一个贴切的类比来说明这背后的逻辑:我们信任医生,不是因为医生无所不知,而是因为医生能够诚实地区分"确诊"和"怀疑"。正是这种区分能力,让我们能够根据医生给出的信息做出恰当的判断和行动。AI如果能做到同样的事情,用户就可以在不需要AI全知全能的情况下,依然从AI那里获得有价值的信息。

---

七、在AI代理系统中,元认知变得更加关键

研究团队还将这个分析延伸到了一个越来越重要的应用场景:AI代理(AI agents),也就是那些能够自主使用各种工具、搜索网络、调用API来完成复杂任务的AI系统。

表面上看,AI代理好像解决了幻觉问题:既然我可以随时上网查,为什么还要担心我的知识是否准确?直接搜就好了。

然而研究团队指出,这个直觉是错误的,工具的存在不但没有减少对元认知的需求,反而放大了它的重要性。

关键在于,AI代理面临的是一个"控制问题",而不仅仅是"存储问题"。工具解决了"存储"——AI不需要把所有信息都装进参数里。但工具制造了新的控制挑战:AI需要判断什么时候需要搜索(如果什么都查,效率极低;如果什么都不查,就退回了没有工具的状态),需要判断搜出来的信息是否可信(网上什么都有,包括大量错误信息),需要在搜到的信息和自己原有的知识发生冲突时做出取舍。所有这些判断,都需要AI对自己的内部确信程度有准确的感知。

研究团队在论文中描绘了一幅图景:元认知能力是连接AI核心能力(推理、语言、知识、指令理解)和外部工具系统(检索、编排、验证、记忆)之间的控制层。没有这一层,外部系统就像是"盲飞"——它无法知道什么时候该查、查完了该信多少、查到矛盾信息时该怎么办。现有研究已经证实,当前的搜索增强型AI代理因为缺乏这种自我感知,普遍存在工具滥用的问题——对根本不需要搜的问题也去搜,效率低下而且引入了不必要的错误来源。

---

八、要实现真正的元认知,还有哪些硬骨头要啃

研究团队并没有停留在描述问题上,他们还系统梳理了要实现忠实不确定性和元认知能力需要解决的几个关键技术挑战。

第一个挑战,研究团队称之为"自举悖论"。要教AI正确地表达不确定性,需要用训练数据来示范什么叫"该犹豫的时候犹豫"。但问题在于,这种训练数据是静态的,而AI的知识边界是动态的——一个事实,可能在训练数据制作时AI不知道,但经过进一步训练后AI已经知道了。如果静态数据里标着"我不确定奥巴马的生日",但现在的AI其实已经能自信地回答这个问题,那这条训练数据反而会训练出一个假装不确定的AI。这需要开发动态数据基础设施,让训练标签能够反映模型当前真实的知识边界,而不是某个过去时间点的快照。

第二个挑战是"对齐之后的信号保留"。现有证据显示,大语言模型在预训练完成之后,其实已经具备相当不错的内部不确定性信号——它的内部状态本来就包含着"这道题我比较有把握"和"这道题我不太确定"的区别。但是,后续的对齐训练(比如RLHF,即用人类反馈做强化学习)会把这个信号破坏掉。为什么?因为对齐训练的目标是让AI更有用、更符合人类偏好,而人类普遍偏好语气确定、给出答案的回复——这就逼着AI学会了无论内部多么摇摆,对外都表现得很自信。如何在保留有用性和安全性的同时,不把这个珍贵的内部信号磨掉,是一个需要专门设计的"保留不确定性"对齐算法来解决的问题。

第三个挑战是"置信度归因"。要高质量地表达不确定性,光说"我不太确定"还不够,还需要说清楚"为什么不确定"——是因为问题本身有歧义,是因为AI确实不知道这件事,还是因为不同的价值观或标准会导致不同的答案?不同原因导致的不确定性,需要用不同方式来表达。"这取决于您对X的具体定义"和"我对这件事没有记忆",表达的是完全不同性质的不确定性,但两者都属于"不确定"。研究团队认为,高质量的元认知需要AI能够追溯不确定性的来源,并映射到恰当的语言表达。

第四个挑战是"因果性评估"。这是一个更深层的科学问题:我们如何确认一个AI真的在感知自己的内部状态,而不是学会了一套表面的"表演不确定性"的规律?比如,一个AI可能学到"遇到生僻实体名称的问题就加上'我不太确定'"这样的简单启发式规则,但这只是在模仿不确定性的外表,而不是真的在读取内部信号。如何设计评估框架,能够区分"真正的元认知"和"对元认知的表演",是研究团队认为非常基础性的工作。

第五个挑战是"在代理场景中评估元认知"。在AI代理系统里,怎么评估元认知能力?研究团队认为,现有的评估方式太过关注"最终答案对不对",而忽略了过程中的控制决策是否合理。一个AI代理可能通过搜索"碰巧"得到了正确答案,但它的判断过程完全是混乱的——它不该搜的时候搜了,该信的信息没信,不该信的信息信了,但最终结果凑巧对了。这样的"成功"是脆弱的,不可复现的。真正的代理评估应该把"该搜的时候是否搜了"、"面对矛盾信息时是否正确取舍"这样的过程指标纳入考核。

---

九、对研究界的实践建议:换一把尺子量问题

研究团队还对评估幻觉缓解效果的研究范式提出了具体的改进建议。

当前研究中常用的评估指标存在一个共同的盲点:它们都在某种程度上掩盖了"消灭幻觉所付出的实用性代价"。比如校准误差(ECE)是一个聚合指标,平均掩盖了判别力缺口的存在;AUROC虽然更能反映判别力,但它也是一个汇总数字,无法直接告诉你"把错误率压到5%需要放弃多少正确答案"。

研究团队建议,未来的研究应该直接可视化"实用性-错误率权衡曲线"——把"为了把错误率降到X,需要放弃多少比例的正确答案"这件事,以曲线的形式画出来。只有这样,才能真正看清楚一个方法是真的提升了AI的判别能力,还是只是在同一条曲线上调了一下参数(比如调高了拒绝回答的门槛),并没有实质性地改变底层能力。

与此同时,研究团队建议要警惕干预措施带来的"附带损伤"。把AI调教得在某类生僻问题上更谨慎,往往会让它在其他领域也变得过于谨慎,影响整体的帮助能力。评估一个方法的真实效果,需要同时在一整套任务上测试,包括推理、编程、写作等,看看为了降低知识问答里的错误率,究竟在哪些地方付出了代价。

---

归根结底,这篇研究想说的是:与其继续把"幻觉"当成一个需要彻底铲除的顽敌,不如换一个视角,把它当成一个需要诚实承认和管理的现实局限。AI可以不全知全能,但它必须对自己知道什么、不知道什么有诚实的认识,并且诚实地传达给用户。

就像我们不需要医生无所不知,我们只需要医生在开处方的时候,能清楚地告诉我们"这个我很确定"和"这个我还在观察"——正是这种诚实,让医患之间建立起了真正的信任。AI也应该走向这条路,而不是无止境地追逐一个完美无误的幻象,同时让自己在这个过程中越来越沉默或越来越不诚实。

研究团队的这一视角,并非主张放弃让AI更准确的努力。恰恰相反,他们认为两件事应该并行:继续拓展AI的知识边界,同时让AI学会诚实地表达剩余的不确定性。这两件事相辅相成,一个更博学且有元认知的AI,从任何角度来说都比只有其中一项的AI更值得信赖。有兴趣深入了解这项研究完整论证过程的读者,可以通过arXiv编号2605.01428查阅全文。

---

Q&A

Q1:AI幻觉中提到的"判别力缺口"是什么意思,为什么重要?

A:判别力缺口指的是AI无法在个体问题层面准确区分自己哪些答案是对的、哪些是错的。即使AI整体上"知道"自己大约60%的时候是对的,它也分不清具体哪道题对、哪道题错,因此无法有针对性地对错误答案保持谨慎。这个缺口导致了一个两难:要大幅降低错误率,AI必须对大量实际上正确的答案也拒绝回答,付出巨大的实用性代价。

Q2:AI表达不确定性为什么会被"对齐训练"破坏掉?

A:对齐训练(如RLHF)的目标是让AI的回答更符合人类偏好,而人类普遍更倾向于收到语气确定、直接给出答案的回复,而非犹豫不决的回答。这导致AI在训练过程中被奖励"表现自信"、惩罚"表达犹豫",久而久之,即便AI的内部计算其实很不确定,它也学会了用自信的语气掩盖这种不确定性,原本就存在的内部不确定性信号就这样被训练过程磨掉了。

Q3:在AI代理系统中,元认知能力会影响哪些具体行为?

A:元认知能力直接影响AI代理的多个关键决策。首先是工具调用的时机判断——当AI对某个问题本已有足够把握时,它应该知道不需要额外搜索,而不是什么都去查一遍;其次是对检索结果的取舍——当搜回的信息与AI自身知识冲突时,它需要根据各自的可信程度做出判断,而不是无脑相信最新检索到的内容;最后是任务终止的时机——什么时候信息已经足够,什么时候还需要继续验证,这些都依赖于AI对自身确信程度的准确感知。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-