微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 上海人工智能实验室让AI"少说废话"——ThoughtFold如何折叠掉AI的冗余思维

上海人工智能实验室让AI"少说废话"——ThoughtFold如何折叠掉AI的冗余思维

2026-06-10 11:46
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-10 11:46 科技行者

这项研究来自上海人工智能实验室,联合中国科学技术大学与香港中文大学MMLab共同完成,发表于2026年第43届国际机器学习大会(ICML 2026),论文编号为arXiv:2606.03503。

你有没有遇到过这样的人:问他一个简单的问题,他能绕来绕去说上半小时,反复自我怀疑、自我纠正、兜圈子,最后给出一个完全可以用三句话说清楚的答案?现在的AI推理模型,恰好就是这种"话痨"的典型代表。

近年来,以DeepSeek-R1为代表的大型推理模型在数学、科学等领域展现出惊人的能力,背后的秘诀是让AI在给出答案之前先经历一个"思考过程"——也就是所谓的"思维链"。然而,这条思维链往往冗长至极,充斥着大量重复验证、无效尝试和多余的自我怀疑。研究人员发现,DeepSeek-R1-Distill-Qwen-7B解一道题平均要用掉超过一万个词语,而其中相当大比例的内容对得出正确答案毫无贡献。

上海人工智能实验室的研究团队决心解决这个问题。他们提出了一套名为ThoughtFold(思维折叠)的训练框架,核心思路是:找出AI思维链里那些"废话"片段,然后训练AI学会直接跳过它们,把思路直接从有价值的A点跳到有价值的B点,中间那段绕弯子的过程就被"折叠"掉了。实验结果显示,经过ThoughtFold训练后,DeepSeek-R1-Distill-Qwen-7B的平均用词量减少了约56%,而解题准确率不仅没有下降,反而略有提升。这个结果在当前所有同类研究中名列前茅。

---

一、AI为什么会"想太多"

要理解ThoughtFold解决的问题,先得搞清楚AI的思维链是怎么练出来的,以及为什么这个训练方式天然会制造出冗余。

目前训练AI推理能力的主流方法叫做"基于可验证奖励的强化学习",可以把它理解成一种奖惩机制。AI尝试解一道题,如果最终答案对了,整个思考过程就获得奖励;如果答案错了,就获得惩罚。AI在这种反复尝试和奖惩中逐渐摸索出解题的方法。

问题在于,这套机制只看最终答案对不对,不管过程怎么走。于是AI在思考过程中绕了一大圈,走了好几段弯路,最后侥幸得出正确答案——整个过程都被奖励了,包括那些弯路。AI因此学到的不仅是正确的推理方法,还有那些弯弯绕绕的冗余步骤。久而久之,AI就练成了"话痨"体质:每解一道题都要先自我怀疑一番,反复验证已经确认过的事情,尝试一些明显跑偏的方向再把它们否定掉。

研究团队把这种冗余分成两大类。第一类叫"自我重复",就是AI在逻辑上已经到达终点了,但还是继续生成一堆重复或无关的文字,就像写作文凑字数一样。第二类叫"偏轨尝试",就是AI在思考过程中试探了一些完全错误的方向,花了大量篇幅去探索,最后宣告这条路不通再折回来。这两类冗余都是奖励机制造成的副产品,因为只要最终答案正确,训练系统就不会惩罚这些浪费。

之前也有一些研究团队尝试过解决这个问题,他们的办法是在奖励函数里加一个"长度惩罚"——答案越长,扣分越多,这样AI就有动力写短一点。但研究团队指出,这种方法治标不治本,因为它对整条思维链施加了同等的压力,不管某个步骤是在说有用的话还是废话,都同样被鼓励压短。结果是什么?AI为了少扣分开始乱省略,关键的推理步骤也被草草带过,导致准确率下降。

ThoughtFold的思路截然不同:与其对整条思维链施压,不如精准找出哪些步骤是废话,然后专门针对那些废话进行惩罚,同时保护好有价值的推理步骤。这就需要一个能区分"废话"和"有效推理"的机制。

---

二、让AI自己找出自己的废话

ThoughtFold的第一个核心设计叫做"内省式冗余识别",可以把它理解成一种"自我审查"机制:让AI对自己已经写好的思维链做手术,逐步切掉一些部分,然后检验剩下的内容是否还能导向正确答案。

具体来说,当AI解出一道题并得到正确答案后,研究团队不急着拿这道题去训练,而是先对这条思维链做一次"可折叠性测试"。测试分两个阶段,每个阶段都用到一种叫做"二分搜索"的技术——这种技术类似于猜数字游戏:你要猜一个1到100之间的数,每次报告"高了"或"低了",最多7次就能精确定位。

第一阶段叫做"尾部截断",专门处理"自我重复"问题。研究人员从思维链的末尾开始截断,看截到多短之后AI还能给出正确答案。比如原来的思维链有100个步骤,他们先试着截到50步,如果AI从第50步直接跳到答案还是对的,就说明后50步是废话;然后再试截到25步,如果还对,后75步都是废话……用这种二分法快速找到思维链最精简的有效长度。

第二阶段叫做"内部折叠",专门处理"偏轨尝试"问题。经过第一阶段截短后的思维链里,可能还藏着一些内部的冗余步骤——那些明显跑偏的探索。为了找出哪些步骤贡献最小,研究团队采用了一个非常巧妙的方法:看AI生成答案时,注意力集中在哪些思维步骤上。

这里涉及到一个神经网络的基本机制——"注意力"。AI在生成每个词的时候,会对之前出现过的所有词分配不同程度的关注,关注度高的词对当前输出的影响大,关注度低的词影响小。研究团队把这个机制反向利用:观察AI在写答案时,对思维链里哪些步骤的关注度最低,那些低关注度的步骤很可能就是"路过但没有贡献"的冗余。

具体计算时,他们选用了AI模型中间层的注意力数值——既不用最浅的层(太嘈杂,主要反映表面词语关系),也不用最深的层(太专注于直接预测答案),而是用中间层来捕捉更稳定的语义关联。实验验证了这个选择是合理的:用中间层注意力识别出的冗余步骤,删除后对准确率的影响最小。

基于注意力分数排出各步骤的"重要性排名"后,再次进行二分搜索:先保留最重要的50%步骤,去掉其余50%,验证AI还能否答对;如果可以,再试保留25%……直到找到能维持正确答案的最精简步骤组合。

整个"内省"过程结束后,就会产生一批对比数据:有些是成功压缩版(更短但仍然正确),有些是压缩过头版(太短导致答错)。这些数据就成为后续训练的原料,告诉AI哪些压缩是正确的,哪些是把必要内容也删掉了。

值得一提的是,为了减少随机性带来的误判,每次验证压缩版思维链是否有效时,研究团队不是只试一次,而是并行验证4次,只有当四次中至少三次答对,这个压缩版本才被认定为有效。这样可以避免因为偶然运气答对就错误地把某个关键步骤认定为冗余。

---

三、精准惩罚:让AI学会"跨越"而非"删减"

找到了冗余,接下来的问题是:怎么训练AI?

传统方法会给AI看"好的回答"和"坏的回答",让它学着倾向于好的。但这里有个微妙的陷阱:压缩版思维链和原始思维链共享了大量相同的步骤。如果对整个压缩版进行奖励,对整个原始版进行惩罚,那些共同的步骤就会同时被奖励和惩罚,AI收到的信号相互矛盾,最终可能反而变得更差。

研究团队针对这个问题设计了一套"动态遮罩策略"。可以这样理解:他们准备了两份思维链,一份较短的(成功删掉了废话),一份较长的(包含废话)。他们用记号笔在这两份材料上做标注,只标出关键的部分,其余部分遮住不看。

对于"成功压缩"的案例,他们的标注方式是这样的:在较长版本上,只标出那些被删除的冗余步骤,告诉AI"这些步骤是废话,要惩罚";在较短版本上,只标出"折叠锚点"——也就是压缩后紧接在被删除内容之后的那个步骤,告诉AI"这个跨越是正确的,要奖励"。所谓折叠锚点,就像一座桥的桥头:原本需要绕远路才能到达的地方,现在可以直接跨过去,而这个桥头就是"锚点"。

对于"压缩过头"的案例,处理方式不同:在较短(但答错的)版本上,惩罚那个过于激进的折叠锚点和错误答案;在较长(正确的)版本上,只奖励正确答案本身。这样传递的信息是:这个跳跃太激进了,太重要的内容被跳过了,要谨慎。

通过这种精准的"只标注真正重要的部分"的策略,AI可以清晰地学到:哪些步骤是真正的废话(惩罚),哪种跨越方式是有效的捷径(奖励),哪些步骤是不能省略的(不干预,保持原状)。

这套精细化的偏好学习还需要和原本的强化学习(GRPO)结合使用。道理也很简单:精细化学习只聚焦在删冗余这件事上,很多必要的推理步骤根本没有接收到任何训练信号;如果完全依赖精细化学习,AI的推理能力可能会因为缺乏整体监督而退化。于是ThoughtFold把两种目标合并成一个总目标函数,用一个系数λ来调节两者的权重。实验发现,λ=0.1时效果最好——足够的精细化信号让AI学会精简,足够的整体监督让AI保持准确。

---

四、实验数据:精简了多少,准确率怎么样

研究团队在四个模型上进行了全面测试,包括DeepSeek-R1-Distill-Qwen-7B、DeepSeek-R1-Distill-Qwen-14B、Qwen3-8B和Qwen3-14B,覆盖了从小学应用题到顶级数学竞赛、再到研究生科学问题的五个基准测试。

以DeepSeek-R1-Distill-Qwen-7B为例,原始模型平均用词量超过一万,经过ThoughtFold训练后降至约4496,减少了56.1%,而总体准确率从64.56%提升到67.38%,提升了约2.82个百分点。这意味着AI不仅说话更简洁了,解题还更准了。

与"长度惩罚强化学习"方法相比,ThoughtFold在准确率上有显著优势,尤其在困难题目上。以AIME 2025(美国数学邀请赛2025年题目)为例,长度惩罚方法的准确率降到35.5%,而ThoughtFold维持在39.1%,与未经任何精简训练的原始模型持平——这说明ThoughtFold在大幅压缩的同时没有破坏复杂推理能力。

与S-GRPO(当时最先进的高效推理方法)相比,ThoughtFold在准确率和效率上均有提升。以Qwen3-8B为例,S-GRPO的总体准确率约为77.3%(AIME 2024),ThoughtFold达到78.1%;在用词量上,ThoughtFold也略少。

尤其值得关注的是跨领域泛化能力。研究团队在GPQA Diamond(研究生级别物理、化学、生物题目)这个与训练数据完全不同的领域测试模型,结果显示ThoughtFold的准确率提升幅度依然明显。这说明ThoughtFold训练出的是一种真正意义上更简洁的推理习惯,而不是简单地"记住了短答案的格式"。

---

五、消融实验:每个设计环节到底有多重要

为了验证ThoughtFold各个设计环节的必要性,研究团队在Qwen3-8B上进行了系统的"拆零件"测试。

第一个测试是把注意力引导的步骤重要性打分换成随机选择——也就是说,不根据AI自己的关注度来决定删哪些步骤,而是随机删。结果是总体准确率从79.00%降到77.90%,用词量也从5874增加到6511。注意力机制确实有效地识别出了更好的删除候选。

第二个测试是去掉"内部折叠"阶段,只保留"尾部截断"。结果准确率降到78.68%,用词量增加到6628。这说明单纯截断尾部能去掉一部分冗余,但内部散布的偏轨尝试无法被处理,留下了不少废话。

第三个测试是去掉"动态遮罩策略",对整条思维链做全局奖惩而非精准标注。这个结果最为惨烈:准确率直接跌到75.80%,甚至低于什么都不做的标准GRPO基线(77.08%)。这印证了研究团队对"矛盾梯度"问题的判断——当共同步骤同时受到奖励和惩罚时,AI会陷入混乱,推理能力反而下降。动态遮罩策略不是可选的锦上添花,而是整个框架正常工作的必要条件。

---

六、AI的思维地图:从迷宫到直线

为了更直观地展示ThoughtFold改变了什么,研究团队做了一个有趣的可视化分析:把AI的思维过程画成一张地图。

他们把思维链里每个步骤的语义内容提取出来,将语义相近的步骤归为同一个"概念节点",然后按时间顺序把步骤之间的跳转画成箭头。这张"概念图"就像一张思维流程地图,可以直观看出AI在解题时走了什么路径。

原始的Qwen3-8B模型的地图看起来像一团乱麻:有长距离回跳(走到第6步忽然跳回第1步重新开始),有局部循环(在第14、15步来回打转),有大量的折返和绕行。

而经过ThoughtFold训练的模型,地图变成了一条基本笔直的线:从问题出发,依次经过关键推理节点,直接到达答案,中间几乎没有回头路和绕弯子。

研究团队还做了一个更数学化的分析,用"马哈拉诺比斯距离"来衡量AI内部表示空间的几何结构。通俗地说,这个分析看的是:AI的思维轨迹在数学意义上是紧凑的还是发散的?结果显示,ThoughtFold对思维分布的核心部分(主流推理方式)影响很小,但大幅压缩了"尾部"——那些偶尔产生的极端冗长轨迹。相比之下,长度惩罚方法虽然也压缩了核心,但在极端情况下的尾部反而更加发散,说明它有时会产生非常不稳定的推理行为。

---

七、一道竞赛题的三种解法

论文中展示了一个具体案例:一道关于在数学表达式"2×3×4×5+1"中插入括号能得到多少种不同值的题目。

原始Qwen3-8B在解这道题时用了约12000个词语。它的思路时不时打转,反复检验同一个情况,甚至尝试了"把1移动到4旁边得到(4+1)"这种改变了原表达式的无效方向,最后用很大篇幅把自己否定掉。虽然最终答案是正确的4,但过程充满了不必要的徘徊。

加了长度惩罚的Short-RL版本用了约7000个词,比原来短了不少。但问题出现了:为了求短,它在推理过程中跳过了必要的验证步骤,结果被自己的一个错误假设带偏,最终给出了错误答案"21"。这正是研究团队担心的问题:全局压缩会误伤关键步骤。

ThoughtFold版本用了约5000个词,比Short-RL还短,且答案正确。它的推理路径干净利落:先确认括号无法改变乘法的结合方式(因为乘法满足结合律),所以只有加法的位置能产生不同结果,然后枚举加法与不同后缀结合的四种情况,得出答案4。整个过程没有任何无效探索,也没有任何重复验证。

---

归根结底,ThoughtFold解决的问题用一句话可以概括:AI学会了"想清楚再说",而不是"边想边说所有废话"。

这对普通用户的直接意义是:同样的AI能力,可能只需要目前一半左右的计算资源。对于运营AI服务的公司来说,这意味着成本可以大幅下降;对于在手机或平板上运行AI的用户来说,这意味着响应速度可以更快、耗电更少。更深远的影响是,当AI能更清晰地推理,它的"思路"也更容易被人类理解和审查,这对AI的安全性和可解释性都有正面意义。

当然,这项研究也有一些局限值得思考。目前的测试主要集中在数学和科学问题上,这类问题有标准答案,可以精确验证压缩后的思维链是否仍然正确。对于开放性问题或创意任务,如何定义"冗余"就不那么清晰了。此外,"内省"过程需要对每条正确思维链进行多次验证计算,虽然研究团队说开销"可忽略",但在极大规模的训练场景下,这仍然是一个需要考量的因素。

有兴趣深入了解技术细节的读者,可以通过论文编号arXiv:2606.03503查阅完整论文。

---

Q&A

Q1:ThoughtFold是如何判断哪些推理步骤是"废话"的?

A:ThoughtFold通过两种方式识别冗余步骤。首先,它从思维链末尾开始截断,用二分搜索找出"尾部废话"——那些在逻辑上已经完成推理之后还在继续生成的内容。其次,它利用AI模型内部的注意力机制打分,观察AI在生成答案时对哪些思维步骤关注度最低,低关注度的步骤被认为贡献较少,是候选删除对象。但最终判断是否可以删除,还要经过实际验证:删掉后还能答对,才算真的是废话。

Q2:为什么普通的"答案越短奖励越多"的训练方式会降低准确率?

A:因为这种全局长度惩罚对思维链里所有步骤施加同等的压力,不区分哪些步骤有用、哪些没用。AI为了减少惩罚,有时会把关键推理步骤也压缩掉,导致逻辑跳跃太大、答案出错。ThoughtFold的做法是精准识别哪些步骤是冗余,只惩罚那些步骤,保护有用的推理不受干扰,所以在大幅缩短长度的同时准确率反而有所提升。

Q3:ThoughtFold训练出的AI在数学之外的领域也有效吗?

A:从现有实验来看,有一定的跨领域泛化能力。研究团队在研究生级别的物理、化学、生物题目(GPQA Diamond)上测试,发现ThoughtFold训练后的模型准确率依然提升,尽管训练数据只包含数学题。这说明ThoughtFold培养的是一种通用的"精简推理习惯"。不过,当前研究主要在有标准答案的问题上验证,对于开放性、创意性任务的效果还有待进一步探索。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-