
这项由麦吉尔大学、魁北克人工智能研究所(Mila)和德克萨斯大学奥斯汀分校联合开展的研究,以预印本形式于2026年6月7日发布于arXiv平台,论文编号为arXiv:2606.08432。研究团队提出了一种名为"轨迹精炼蒸馏"(Trajectory-Refined Distillation,简称TRD)的新方法,专门针对大型语言模型训练中一个长期被忽视的结构性缺陷,并在多个顶级数学竞赛题目测试集上取得了显著的性能提升。
**一、从一个让AI头疼的老问题说起**
要理解这篇研究,先考虑这样一个场景:你有一个刚学做菜的徒弟,正在练习炒番茄炒蛋。你作为师傅站在旁边,希望通过实时点评来帮助他进步。问题来了——当徒弟一开始就把葱和蒜放错了顺序,导致锅里的味道完全跑偏,你在这道菜的每一步之后给出的点评,还有意义吗?
这正是当前AI大模型训练中一个真实存在的困境。在AI领域,"蒸馏"是一种常见的训练手段:让一个能力较弱的"学生模型"去模仿一个能力较强的"教师模型",从而快速提升自身水平。最近几年流行的一种做法叫做"在线蒸馏"(On-Policy Distillation,简称OPD),它的特别之处在于:教师不是在自己写好的标准答案上给学生批改,而是跟着学生实际走的解题路径,逐字逐句地给出指导。这样做的优势是显而易见的——教师的点评是量身定制的,学生能获得极为密集的反馈信号。Qwen3、DeepSeek-v4、MiMo-v2等当下最受关注的大模型,都在训练流程中采用了这种策略。
然而,这套系统有一个致命的漏洞,而这篇研究正是为了找出并修复它。
**二、前缀失效:当徒弟一开始就走错了路**
研究团队将这个漏洞命名为"前缀失效"(Prefix Failure)。要理解它,继续用厨房的比喻来说明。
"前缀"在这里指的是解题过程的前半段——学生模型在开始回答问题时走过的那段路。如果学生在解一道数学竞赛题时,一开始就选错了解题策略,比如用了一个根本行不通的方法,那么从那个错误节点往后,整条路就已经偏了。这就是前缀失效:学生走上了一条"死路",无论后面怎么努力,也很难不回头就走到正确答案那里去。
在线蒸馏的问题就在这里:即便是面对这样一条已经走偏的路,教师模型还是要一步一步地沿着学生的错误路径,给出每一步的"最优建议"。这就像你作为师傅,徒弟的番茄炒蛋已经放错了顺序、火候全错,你还要站在一锅糊掉的菜旁边,认真地点评说"这一步你应该多放点盐"——这个建议不能说没道理,但对于挽救这道菜已经没有实质意义了。
更麻烦的是,当前缀已经失效,教师模型自身也会陷入一种混乱状态。它内心其实有两种声音:一种声音说"按照现在的路继续走吧,保持语义连贯",另一种声音说"不对,要赶紧纠正回到正确答案那边"。这两种声音同时存在,导致教师给出的指导信号变成了一种"双峰混合"——一半在推着学生继续错下去,另一半在拉着学生往正确方向走。这两种方向截然相反的力量叠加在一起,对学生模型来说等于是在传递一个嘈杂、矛盾的信号,甚至比没有指导还要有害。
**三、为什么在每个词上修补都没用**
面对这个问题,研究者们以前的思路是在"损失函数"上做文章——也就是调整每一步点评的权重。有人说高分差的地方要剪掉,有人说要放大特定类型的词的权重,还有人提出各种重新加权的方案。这些方法都是在学生走过的那条错误路径上,对每个词的指导信号做微调。
研究团队通过严谨的数学推导揭示了这些方法的根本局限性。他们用一组公式展示了一个关键对比:理想状态下,教师的纠正应该是沿着一条"修正路径"展开的——第一步纠正之后,第二步的建议应该基于第一步已经被纠正的状态,第三步基于第二步……就像修路一样,要一段接一段地重新铺好。然而,在线蒸馏实际做的是:每一步的建议都是基于学生原来那条错误路径的当前位置给出的。教师在t时刻建议"应该走这条正确的路",但到了t+1时刻,背景已经变成了学生沿着错误路又走了一步,教师只好在这个新的错误节点上再次建议"应该走正确的路"……如此反复,教师一直在重复同一个"纠正起点"的建议,却永远无法真正给出"纠正之后下一步该怎么走"的指导。
换句话说,这些基于词语级别的修补方案,处理的是"应该给每个词多大权重"的问题,但真正的问题根源在于"学生走的整条路就已经走偏了"。修补权重就像在一份做坏了的菜上撒更多或更少的调料,根本问题不在调料的多少,而在于整道菜从一开始就做错了。
研究团队还通过实验数据验证了这一判断。他们发现,在训练过程中,无论是正确还是错误的解题路径,学生和教师的逐词预测几乎没有差异——也就是说,教师在学生走错的路上,几乎给不出任何有价值的纠正信号。与此同时,教师在每个位置分配给"等等""其实""但是"等自我纠正词语的概率质量高达总概率的6-8‰,而正确路径上这个比例会下降到2‰以下。这意味着教师模型确实"知道"自己在一条错误路径上,一直在尝试触发纠正,却因为整个框架的结构性限制而无法真正完成纠正。
**四、轨迹精炼蒸馏:先修路,再导航**
研究团队提出的解决方案在思路上非常直接:与其让教师在学生走错的路上一步步地挣扎,不如先让教师把这条路重新走一遍,生成一条更好的路,再用这条更好的路来训练学生。
这就是轨迹精炼蒸馏(TRD)的核心思想。具体来说,整个流程分为两步。第一步,让学生模型按照自己的方式解一道题,得到一条原始的解题过程,称为"原始轨迹"。第二步,把这条原始轨迹交给教师模型,让教师参考学生的思路,但对其中的错误部分进行修正,生成一条更好的"精炼轨迹"。然后,用这条精炼轨迹来训练学生。
这个过程的精妙之处在于两个方面的平衡。一方面,精炼轨迹是以学生的原始路径为起点生成的,所以它不会偏离学生的"认知习惯"太远——毕竟教师也是在看了学生的解法之后才开始修改的,改出来的版本依然保留了学生原有思路的大体框架,只是修正了关键错误。这样一来,这条精炼轨迹就落在学生的"能力支持范围"之内,不会出现教师给出的路对学生来说完全陌生、根本学不了的情况。另一方面,精炼轨迹从根本上绕开了前缀失效问题——既然教师重新生成了整条路,那么就不存在"沿着一条错路继续点评"的困境了,教师在精炼轨迹上给出的每一步指导,都是基于一条连贯、正确的路径展开的,梯度信号不再碎片化。
这就像:与其让师傅站在徒弟做烂的菜旁边硬撑,不如师傅亲自下厨,参考徒弟的做法风格,重新做一遍,让徒弟通过观摩这道"改良版"的菜来学习。
TRD还有一个额外的收益——即便学生原来走的路是正确的,精炼轨迹也依然有价值。因为教师在参考学生的正确解法后,可能会给出一条逻辑上等价但更简洁、更优雅的解法。数据显示,经过精炼的轨迹,正确解法的长度平均压缩了约九倍(从7700个词缩减到880个词左右)。也就是说,TRD不仅能纠错,还能让学生接触到更多样化、更高效的解题方式,拓宽学生的"解题视野"。
**五、自我蒸馏:只用一个模型也能玩**
研究中还提到了另一种更节省资源的变体,叫做"在线自蒸馏"(On-Policy Self-Distillation,简称OPSD)。在标准的在线蒸馏中,你需要一个单独的、更强大的教师模型。但自蒸馏的思路是:同一个模型,在"普通模式"下作为学生解题,在"开挂模式"下作为教师——也就是让它在解题时额外看到正确答案,然后用这个"开挂状态"的输出来指导"普通模式"下的自己。
TRD可以无缝地应用到这种自蒸馏场景中。在自蒸馏版本的TRD里,精炼轨迹的生成过程是:给同一个模型看学生的原始解题路径和正确答案,让它生成一条精炼后的解法,然后用这条精炼解法来训练自己的"普通模式"。这种设计的好处在于,精炼出来的路径天然地更贴近学生模型自身的能力分布,因为教师和学生本就是同一个模型的两种状态。
**六、用数学竞赛题目检验真实效果**
研究团队在多个极具挑战性的数学竞赛题目数据集上进行了系统性实验,这些数据集包括AIME24、AIME25(美国数学邀请赛历年真题)、HMMT25(哈佛-麻省理工数学邀请赛)、BeyondAIME,以及难度最高的AMOBench(专门用来测试模型在高中数学竞赛中表现的基准集,共39道题目)。此外,在标准在线蒸馏的实验框架下,代码生成任务也纳入了评估范围,使用了HumanEval+、MBPP+和LiveCodeBench等代码生成基准。
实验使用的基础模型来自阿里云Qwen3系列,包括Qwen3-1.7B、Qwen3-4B-Instruct和Qwen3-8B三个规模,在标准蒸馏实验中以Qwen3-8B作为独立教师模型,在自蒸馏实验中教师与学生共享同一模型参数。
评估指标采用Avg@16(每道题抽16次,计算通过率均值)和Pass@16(16次里至少有一次正确的比率)。前者衡量模型稳定解题的能力,后者衡量模型是否至少有能力解出这道题。
对比的基线方法包括四种主流的在线蒸馏变体:前向KL散度、带截断的前向KL散度(一种限制过大梯度的改良版本)、反向KL散度,以及带Top-K截断的反向KL散度(只保留教师最有把握的几个词的指导信号)。
在标准蒸馏实验的Avg@16指标上,TRD在两种学生规模的大多数基准上都达到或并列最高水平。对于较小的Qwen3-1.7B学生,在AIME24上的提升幅度达到+4.6个百分点。更能说明问题的是Qwen3-4B-Instruct这一组:几乎所有基于原始错误轨迹的蒸馏变体都无法达到基础模型的表现,而TRD不仅保住了基础模型的能力,还在多个基准上实现了正向提升。这个对比直接印证了研究团队的判断:当学生本身已经足够强时,基于错误路径的逐词指导反而会破坏学生已有的解题分布,而轨迹级别的精炼则提供了更安全的训练目标。
Pass@16指标上,差距在最难的题目上体现得最为突出。在AMOBench这个难度最高的基准上,TRD为Qwen3-1.7B带来了+5.1个百分点的提升,为Qwen3-4B-Instruct带来了+12.8个百分点的提升。
在自蒸馏实验中,结果同样一致:TRD在所有五个数学基准上全部达到最高或并列最高的Avg@16,并且从未低于基础模型水平,而其他四种对比方法中有三种在至少一个基准上出现了倒退。在Pass@16方面,Qwen3-8B在AMOBench上的提升幅度高达+20.5个百分点,相对提升约50%,而最强的基线方法停留在51.3%,TRD则达到了61.5%。
对比分析还揭示了一个有趣的现象:在相同的学生模型规模下,自蒸馏版TRD的Pass@16整体上略优于标准蒸馏版TRD。研究团队认为,这部分是因为自蒸馏的精炼路径通过同一模型生成,天然地更贴近学生的能力范围,避免了教师与学生模型之间可能存在的风格差异或能力错位问题。
**七、精炼轨迹有多不一样**
研究团队对训练数据本身做了细致的对比分析,这部分发现同样很有价值。
精炼轨迹在通过率上显著优于原始轨迹:在Qwen3-8B上,原始轨迹的正确率约为65.8%,精炼后提升至81.4%。从"原来错了,精炼后对了"和"原来对了,精炼后错了"的数量对比来看,前者约为后者的44倍,说明精炼过程主要起到了纠错的作用,而非随机扰动。大约四分之一到三分之一的原始错误路径在经过精炼后仍然无法得到正确答案,这说明当原始路径的错误程度超出了模型能够修正的范围,TRD也并非万能的解药,但在大多数情况下效果是正向的。
精炼轨迹更短,这带来了额外的训练效率提升。由于精炼后的解法更简洁,用精炼轨迹训练时,模型处理的序列更短,整体训练时间反而减少了。在Qwen3-8B上,使用TRD的完整训练流程(包括额外的精炼生成步骤)的总耗时(9小时20分钟)与不使用TRD的标准自蒸馏(9小时40分钟)几乎相当,这意味着精炼生成的额外计算开销被更短的训练时间抵消了。
在测试时的行为分析上,研究团队对AMOBench的39道题目各抽取了128条解题轨迹,分析TRD和普通在线蒸馏模型在这些题目上的表现差异。发现TRD模型的正确解法长度呈双峰分布,存在一个约1万词的短解法峰值,这在普通蒸馏模型中是看不到的。这说明TRD让模型学会了更简洁的解题思路。在Pass@128指标上,TRD模型达到了53.8%,而普通蒸馏模型为46.7%,随着采样次数的增加,差距持续扩大。
最能体现TRD价值的,是对那23道基础模型一次都解不出来的"极难题"的分析。在这些题目上,普通蒸馏方法的Pass@16为22%,而TRD达到了39%。这部分提升不是在原有能力基础上的优化,而是真正扩展了模型能触及的解题边界,让模型开始能够处理以前根本无能为力的题目类型。
**八、代码任务上的表现**
在代码生成任务上,TRD在Avg@16指标上同样超过所有对比基线,在HumanEval+上与最佳基线持平,在MBPP+上达到最高。但在LiveCodeBench这个难度最高的代码基准上,所有方法(包括TRD)都无法超越基础模型。研究团队认为,这说明在极难的代码任务上,当前使用的Qwen3-8B教师模型的精炼能力本身也存在上限,无法为这些超出其能力范围的题目生成有效的精炼轨迹。这也指出了TRD方法的一个边界条件:教师模型本身的能力是精炼质量的天花板。
**九、这项研究告诉我们什么**
归根结底,这项研究做了一件看似简单却很重要的事:它指出了一个大家都在用、但一直没有人系统分析其结构性缺陷的训练方法的漏洞,并提出了一个从根源处解决问题的方案。
对AI研究者来说,TRD提供了一种在不大幅增加计算成本的前提下,显著提升在线蒸馏效果的思路。对普通用户来说,这意味着未来的AI数学解题助手、代码生成工具可能会因为类似TRD这样的训练改进而变得更加可靠——特别是在面对真正困难、复杂的问题时,模型走进"思维死胡同"的情况会减少,找到有效解法的概率会提高。
当然,这项研究也坦诚地指出了自身的局限。TRD需要额外生成精炼轨迹,虽然时间上基本与基线持平,但计算路径更为复杂。更重要的是,TRD的效果高度依赖教师模型的精炼能力——如果教师模型本身也对某类问题束手无策,TRD就失去了其核心来源,也就是说,这套方法对于能力超越当前教师模型的题目类型,暂时还没有解法。
这道"AI学生走错路该怎么办"的难题,看来TRD提供了一个颇有说服力的答案:与其在错误路上反复指点,不如先帮学生重走一遍,再开始教。感兴趣深入了解的读者,可以通过arXiv编号2606.08432查阅完整论文。
---
Q&A
Q1:前缀失效(Prefix Failure)具体是指什么现象?
A:前缀失效是指AI学生模型在解题过程中,一开始就走上了一条错误的推理路径,导致后续所有步骤都建立在错误基础上,即使教师模型逐词给出指导也很难纠正。这个问题的根源在于教师只能在学生已走过的错误路径上逐步点评,而无法真正引导学生回到正确方向。
Q2:轨迹精炼蒸馏(TRD)与普通在线蒸馏方法相比,训练成本会大幅增加吗?
A:不会大幅增加。TRD确实需要额外的一步来生成精炼轨迹,但由于精炼后的解法通常比原始错误解法短得多(约压缩九倍),实际的模型训练时间大幅缩短,两者相互抵消。实验中Qwen3-8B使用TRD的总训练时长(9小时20分钟)与普通自蒸馏方法(9小时40分钟)基本持平。
Q3:AMOBench上TRD为什么提升幅度特别大?
A:AMOBench是测试集中难度最高的数学竞赛基准,包含39道基础模型经常无法解答的难题。正是在这类极难题目上,前缀失效问题最为严重,普通逐词蒸馏几乎无法提供有效指导。TRD通过轨迹级别的修正,让模型能够接触到正确解法的完整推理路径,从而在这类高难度题目上实现了近50%的相对提升。
好文章,需要你的鼓励
这项联合研究发现,将Muon优化器应用于强化学习智能体训练时,搭配合适的步骤级信用分配机制,可使任务成功率提升88%,揭示了优化器与评分机制需协同设计的新方向。
本文介绍了CPO方法,通过让AI将自身回答与参考答案对比,在词级别识别推理对错,从而提供比熵更精准的强化学习训练信号,数学推理性能提升高达8.5%。
RAGU是一个多步骤知识图谱增强生成系统,配套7B参数的Meno-Lite-0.1模型,通过两段式抽取和去重整合构建高质量知识图谱,在综合推理任务上超越HippoRAG 2,成本仅为商业API的百分之一。