微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 浙江大学与阿里巴巴联手:让AI小学生也能在答错时"悬崖勒马",不再一条路走到黑

浙江大学与阿里巴巴联手:让AI小学生也能在答错时"悬崖勒马",不再一条路走到黑

2026-08-06 13:57
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-08-06 13:57 科技行者

这项由浙江大学与阿里巴巴集团优音团队联合开展的研究,以预印本形式于2026年7月28日发布在arXiv平台,论文编号为arXiv:2607.26057。研究团队提出了一种名为"接力式在线蒸馏"(Relay On-Policy Distillation,简称Relay-OPD)的全新训练方法,专门用于解决人工智能语言模型在学习过程中"一错到底"的顽固问题。

教AI模型解题,本质上和辅导孩子做数学没多大区别。如果孩子在第三步就算错了,却没人告诉他,他后面写的所有步骤都是在错误的基础上叠加更多错误。等到最后,整张卷子都是歪的,批改起来连红笔都不知道从哪里标起。研究团队发现,当前主流的AI训练方法正在面对完全一样的困境——而他们找到了一种近似于"实时家教"的解决方案:让更强的老师模型在学生模型刚要走错路的那一刻接手几步,拨正方向后再把笔交还给学生。

一、AI是怎么"上课"的,又怎么会"越学越歪"

要理解这项研究解决的问题,得先聊聊AI语言模型是怎么练成的。训练一个能推理、能解题的大模型,有点像培养一个从零开始的学徒。最常见的做法是给学徒看大量由优秀师傅(即更强大的"教师模型")写好的范文,让学徒模仿着写。但模仿有一个根本弱点:学徒练的是别人走过的路,等到真正自己上场,一旦遇到没见过的岔路,就会发蒙。

更进阶的做法叫做"在线蒸馏"(On-Policy Distillation,简称OPD),可以理解为"边实战边点评"的训练模式。在这种模式下,学生模型不看范文,而是自己真实地去解题,把完整的解题过程写出来。然后教师模型站在旁边,对照学生写下的每一个字,逐字逐句地给出评分和指导。因为点评的是学生自己真实写出的内容,而不是假设学生会怎么写,所以指导更贴合实际,学生进步更快。这种方法近年来已经成为大模型训练的主流手段之一。

然而,"在线蒸馏"有一个被研究团队称为"前缀失败"(prefix failure)的致命弱点。所谓前缀,就是解题过程中已经写下的部分。如果学生在第三行就走偏了方向,后面写的所有内容都建立在这个错误的前提之上。这就好比一个厨师在放盐这步加错了调料,后面不管怎么翻炒、怎么调味,整锅菜的底味都是歪的。更糟糕的是,教师在评点这些后续步骤时,面对的是一个越来越离谱的上下文,它给出的指导也会变得越来越不可靠、甚至有害。与此同时,这些方向已经错了的推理过程往往还很冗长,白白占用了大量的计算资源。

二、教师和学生在错误路口的关键分歧

研究团队在深入分析这个问题时,注意到了一个颇为微妙的现象:当学生模型已经走上错误方向、即将继续深陷其中的那一刻,教师模型和学生模型对"下一步该怎么走"其实有着截然不同的判断。

打个比方,两个人在一道数学题里得出了一个实际上行不通的中间结论,接下来:学生模型倾向于说"所以……"然后继续沿着这个错误结论往下推;而教师模型则更倾向于说"但是……"或者"等等……"——用这些反思性的词语停下来,重新审视这一步到底对不对。

这种差异在论文举的一个例题里体现得相当清晰。题目是:苹果3令吉一个、芒果4令吉、木瓜5令吉,花刚好50令吉,每种至少买一个,最多能买多少个水果?学生模型推算出买15个苹果剩下5令吉,然后得出"还可以再买1个芒果和1个木瓜"的结论,并继续往下算出答案是17个。事实上,1个芒果加1个木瓜要9令吉,剩余的5令吉根本不够。学生已经在错误前提下继续往下走了,而在这个分叉口,教师模型下一个词选择"But(但是)"的概率高达74.4%,而学生模型下一个词选择"So(所以)"的概率则高达50.6%——两者的判断截然相反。

这个"教师想转弯、学生想直走"的分歧,就是研究团队找到的关键信号。更重要的是,识别这个信号不需要任何外部裁判——不需要先知道答案对不对,不需要专门的评分模型,只需要对比教师和学生在那一刻各自倾向于说什么词。

三、提前介入有多重要:从实验结果说话

在正式提出方法之前,研究团队做了一组很有说服力的预备实验,目的是搞清楚"在什么时候、用多大力度介入"最有效。

他们拿Qwen3-4B-Instruct-2507作为教师模型、Qwen3-1.7B-Non-Thinking作为学生模型,在128道数学题上进行测试。实验的基准是:学生自己解题的正确率约为27.73%,教师自己解题的正确率约为60.55%。然后他们模拟"教师在检测到分歧信号时接管一段时间"的效果,改变两个变量:接管时长(用生成的段落数L衡量)和接管时机(是否跳过前几个触发点,等到后面的触发点再介入)。

结果发现了两个规律,一个关于"力度",一个关于"时机"。

关于力度:哪怕教师只替换了整个推理过程中0.35%的词——仅仅是在每个触发点替换一个反思词——正确率就从27.73%跳升到了34.96%,提升了7.23个百分点。随着接管时长从0段落增加到3段落,正确率稳步上升到41.99%。继续增加到6段落,正确率虽然小幅增长到43.55%,但教师词的占比已经从17.52%飙升到28.52%,收益明显趋于平缓。这说明"少量但精准的介入"就能产生显著效果,过度介入则性价比大幅下降。

关于时机:研究团队还测试了"故意跳过前几个触发点、等到后面的触发点再介入"的策略。结果令人印象深刻:同样是接管3段落,在最早的触发点介入时正确率为41.99%;跳过1个触发点后介入,正确率跌到33.98%;跳过3个触发点后介入,只剩29.49%。越晚介入,效果越差。

为什么时机如此关键?研究团队给出了解释:随着推理过程的推进,教师模型也会被学生模型已经写下的那些错误内容"带跑"——共同的错误上下文让教师自己也越来越难以扭转方向。早介入,教师还能拉得住;晚介入,教师自己也被错误的惯性拖着走了。

四、接力训练法的完整设计

正是基于以上发现,研究团队设计了Relay-OPD的核心机制。整个设计可以用一场接力赛来理解:学生拿着接力棒跑,跑着跑着出现了偏道的迹象,教师接过棒子短暂纠正路线后,再把棒子交回给学生继续跑。

具体来说,这套机制分三个核心部分。

第一部分是"换手触发器"(handoff trigger)。研究团队预先定义了一组"反思词",包括"Wait(等等)"、"But(但是)"、"Hmm(嗯)"、"Actually(实际上)"、"Hold(等一下)"、"However(然而)"、"Yet(然而)"、"Oh(哦)"、"Alternatively(另外)"、"No(不对)"、"Ah(啊)"、"Oops(哎呀)"、"Well(好吧)"等词语及其大小写和前置空格变体。这些词都是推理过程中"停下来重新审视"的信号词。触发条件是:教师模型在当前前缀下最倾向于说的下一个词属于这组反思词,而学生模型的前K个候选词里没有任何一个属于这组词。K取5,意思是学生最有可能说的5个候选词里都不包含任何反思词,说明学生根本没有"要回头看看"的意识,只想直走。

第二部分是"接力轨迹构建"(relay trajectory construction)。当触发条件满足时,教师接管,把它倾向说的那个反思词写出来作为起点,然后继续生成L段后再把控制权交回学生。段落以双换行(\n\n)为分隔单位,平均每段约包含23.2个词,这样每次接管都能完成一个完整的推理单元而不是半截话。研究团队设置了一个"接力预算"(relay budget),用参数M控制一次训练轨迹里最多允许教师接管M次。当第M次接管结束后,这条轨迹的生成就终止,不再继续。这个预算机制的作用是:把教师介入集中在最早出现问题的位置,避免轨迹整体偏离学生自身的行为模式太远。

第三部分是训练目标。在这条包含学生段落和教师段落的"接力轨迹"上,训练优化的方式与标准在线蒸馏一脉相承——逐词对比"学生现在有多倾向说这个词"和"教师有多倾向说这个词",鼓励学生向教师靠拢。关键在于:优化是对实际生成出来的词进行的,无论那个位置是学生生成的还是教师生成的。这样一来,教师在接管段落里写下的那些纠正性推理步骤,不只是给了学生一个更好的"语境接力棒",本身也直接成为学生模仿学习的示范材料。

五、用一个引擎完成教师与学生的无缝切换

实现这套机制时,研究团队还面临一个工程上的挑战:如何让教师和学生的来回切换既准确又高效?

朴素的做法是维护两条独立的生成流水线,随时在它们之间切换。但这意味着每次换手都要做大量的状态同步和通信协调,开销极大。研究团队选择了一个聪明得多的方案:把整个接力过程统一放进一个"投机解码"(speculative decoding)引擎里。

投机解码原本是一种加速大模型推理的技术,它的核心逻辑是:让一个小而快的"草稿模型"先猜出接下来的几个词,再让大而准的"目标模型"批量验证这些猜测,一次性接受或拒绝,速度远快于让大模型逐词生成。在Relay-OPD里,学生模型充当草稿模型,教师模型充当目标模型。在学生段落,学生模型的每个猜测都会被100%接受(因为目标模型就是学生本身),等同于正常的学生自主生成。在教师段落,则执行标准的投机解码验证流程,每个学生的猜测都要经过教师审核,不符合教师分布的词会被替换。

这个设计的额外收益是:教师模型在验证学生猜测的同时,顺手就计算出了自己在当前位置最倾向于说什么词——这正是触发换手所需要的信息——完全不需要额外的计算开销。

六、实际效果:在八个数学竞赛基准上的比拼

研究团队在正式实验中使用Qwen3-4B-Instruct-2507作为教师,分别对Qwen3-0.6B-Non-Thinking和Qwen3-1.7B-Non-Thinking两个学生模型进行训练,并在八个数学推理基准测试上进行评估,涵盖AIME 2024、AIME 2025、AIME 2026、MATH500、AMC 2023、OlympiadBench、HMMT February 2026和HMMT November 2025。训练数据使用DAPO-Math-17K的英文子集,整个训练过程在8块H100 GPU上进行。

对于1.7B的学生模型,Relay-OPD的平均正确率达到46.96%,而标准在线蒸馏(OPD)只有41.23%,差距为5.73个百分点。最强的竞争对手FastOPD平均为45.47%,Relay-OPD领先1.49个百分点。在最难的竞赛题目上,提升尤为显著:AIME 2025的准确率从25.52%提升至32.81%,提升了7.29个百分点;AIME 2026从23.33%提升至30.52%,提升了7.19个百分点。对于0.6B的学生模型,同样的趋势成立,平均准确率从28.03%提升到31.04%,比FastOPD高出0.62个百分点。

除了准确率,训练效率的提升同样惊人。1.7B学生的训练轨迹平均长度只有2296个词,而标准OPD需要4658个词,缩短了50.7%;0.6B学生的轨迹从6900个词压缩到2490个词,缩短了63.9%。Relay-OPD在第35步就达到了最佳表现,而标准OPD需要55步,FastOPD需要45步。更短的轨迹、更少的训练步数,意味着消耗的计算资源大幅减少。

研究团队还在HMMT的两个竞赛基准上测试了"pass@k"——即给每道题生成k个答案,只要有一个答对就算通过,考察模型的"上限能力"。无论k取8、16、32、64还是128,Relay-OPD的pass@k都稳定高于标准OPD,说明它不仅提升了平均水平,也拓展了模型的能力边界。

在推理阶段(即训练完成后的实际使用),Relay-OPD生成的答案更短。与FastOPD相比,在AIME 2025上短17.9%,AIME 2026上短14.2%,HMMT February 2026上短28.3%——同时准确率还更高。换句话说,Relay-OPD训练出来的模型不仅答得更对,还答得更精炼。

七、对比同类方法:各自的优劣

在实验中,研究团队还和几种同样致力于解决"轨迹偏差"问题的方法进行了比较,每种方法都有各自的思路,也各自有各自的局限。

TRD(轨迹重写蒸馏)的做法是让学生先完整解一遍题,然后把学生的解题过程交给教师,让教师"修改作文",再在改好的版本上训练学生。这个方法听起来合理,但实验结果却远低于预期——1.7B学生用TRD训练后平均只有30.69%,比不用任何特殊手段的标准OPD的41.23%还要低。研究团队在查看训练数据时发现了原因:教师改出来的"作文"里,出现了大量明显的改稿痕迹,比如"根据我的初始解法……"、"经过修改……"、"重新评估后……"这类语言,让整个解题过程读起来像是在描述一次作文修改,而不是像一个人自然地思考数学题。这种"不自然"的轨迹反而干扰了学生的学习。

SKD(投机知识蒸馏)的做法是在每个词的位置,检查学生猜的词是否落在教师最可能说的前K个词里,如果不在,就用教师的词替换。这种方法是逐词介入的,但介入信号来自于通用的分布差异,而不是专门识别"推理方向是否走偏"。实验中,SKD在1.7B上只比标准OPD好了一点点(42.35% vs 41.23%),在0.6B上反而更差(24.38% vs 28.03%)。更具体的问题在于:研究团队在案例分析中发现,当学生进入了一个反复输出相同答案的循环时,那些重复内容的词语通常也在教师的候选词里,于是SKD的替换机制完全无法打破这个循环,学生就一直重复输出"最终答案:没有整数n……最终答案:没有整数n……"。

FastOPD(快速在线蒸馏)的思路是:既然训练轨迹的后半段充满了基于错误前缀的不可靠内容,那干脆截断,只训练前面固定长度的部分。在1024、2048、4096、8192四个截断长度里,4096效果最好,达到了45.47%的平均准确率,是除Relay-OPD外最强的方法。但FastOPD只是"少看错误的部分",并没有给学生展示"当错误发生时应该怎么纠正",学生依然不知道遇到岔路该怎么办。Relay-OPD的优势恰恰在于它不仅截短了轨迹,还在截断之前插入了一段由教师示范的"纠错过程",让学生学到了"遇到问题时应该退一步重新审视"这个能力。

八、训练过程的动态变化与多组消融实验

研究团队还详细追踪了整个训练过程中Relay-OPD的行为变化,以及通过消融实验验证了各个设计选择的必要性。

在训练动态方面,随着训练步数的推进,三个指标都在发生变化。"预算耗尽率"(每条训练轨迹都用完了全部M次接管机会的比例)从训练初期的75%-85%逐步下降到后期的50%-60%,说明学生模型越来越少地触发换手条件,自己走偏的情况减少了。"教师词占比"从训练初期的约13%急速下降,在约20步之后稳定在2%-3%,说明随着学生能力的提升,需要教师介入的时刻越来越少。这两个趋势共同说明,随着训练进行,学生和教师的能力差距在缩小,前缀失败的发生率降低了。与此同时,Relay-OPD的策略熵(可以理解为模型在做选择时的"开放程度"或"探索意愿")在整个训练过程中都高于标准OPD和FastOPD。研究团队认为这是因为教师接管改变了学生见到的前缀分布,让学生探索了更多不同的推理路径,从而保持了更高的多样性。

在消融实验方面,研究团队首先验证了"教师腿"本身的价值。他们对比了两种只允许接管1次(M=1)的变体:一种是在触发后立刻终止轨迹、不生成任何教师词(Trigger-stop);另一种是在触发后让教师生成L=3段(Relay-OPD M=1)。前者平均准确率43.48%,后者46.25%,差距2.77个百分点。这说明仅仅"及时截断错误轨迹"是不够的,教师生成的那段纠正性内容本身带来了额外的学习价值。

研究团队还对比了三种不同的训练目标。他们发现,直接对教师实际生成的词(relay token)计算损失的效果最好(46.96%)。如果改成对学生原本会说的词(student draft token)计算损失,效果下降到44.56%——因为这种方式主要是压制学生不该说的词,但没有明确告诉学生应该说什么。如果改成让学生模仿教师的完整分布(Teacher FKL),效果下降到44.08%——因为在已经走偏的前缀上,教师自己的判断也并不完全可靠,强迫学生全面模仿会引入噪声。这一结果印证了设计时的直觉:在错误的上下文下,选择性地吸收教师的纠正信号,比全面模仿教师分布更合适。

在超参数敏感性方面,L从0到4,准确率从44.31%稳步上升到47.10%;L=5时小幅下滑到46.47%,说明教师腿不宜过长。M从1到2提升效果明显,但M=4时准确率跌到44.01%,说明接管次数过多会让轨迹离学生自身策略太远,破坏在线蒸馏的优势。K从1到5,准确率从44.27%提升到46.96%;K=10时下降到43.14%,K等于整个词表时退化为标准OPD的41.23%。K=5是最优配置,太小会在微小分歧上频繁触发,太大则错过真正需要介入的时机。

九、方法的局限与未来方向

研究团队在论文末尾坦诚地说明了这项工作目前的局限。评估只覆盖了数学推理任务,使用的也是Qwen3系列的教师-学生配对。接力机制本身在设计上并不局限于数学,但在代码生成或智能体任务等其他领域的有效性还有待验证,而且换到不同的模型家族时,反思词列表可能需要重新调整。此外,这套方法的核心假设是教师模型在纠正错误前缀方面明显强于学生,当教师和学生的能力差距本就很小时,接力介入的价值会自然缩减。最后,接力预算的超参数是在1.7B学生上调出来的,复用到0.6B时虽然也表现良好,但在面对新的模型配对时可能需要重新寻优。

归根结底,这项研究用一个相当朴素的直觉解决了一个长期困扰AI训练的实际问题:学生一旦走错路,就让更有经验的老师短暂接手,扭转方向后再放手。这个"点到为止"的介入哲学,在实验数据上被证明是既有效又高效的。它让小模型在资源有限的训练条件下,能学到的不只是"正确答案是什么",更是"发现自己走错时该怎么办"。对于那些关心AI如何在有限计算资源下变得更聪明的读者,这篇来自浙江大学与阿里巴巴联合团队的工作,提供了一个值得认真对待的思路。有兴趣深入了解技术细节的读者可以通过arXiv:2607.26057查阅完整论文。

Q&A

Q1:Relay-OPD的换手触发器是怎么判断该介入的,需要知道答案对错吗?

A:不需要。Relay-OPD的触发条件完全基于教师和学生对"下一个词"的偏好差异——当教师最倾向于说某个反思词(如"But""Wait"),而学生最可能说的前5个词里没有任何反思词时,系统判定出现了推理方向分歧,触发介入。整个过程不依赖答案标注、过程标签或任何外部评分模型。

Q2:为什么训练轨迹缩短超过50%,准确率反而比标准OPD更高?

A:因为Relay-OPD同时做了两件事:一是截断了错误方向上的冗长推理,避免这些低质量内容干扰训练;二是在截断前由教师生成了一段纠正性的推理示范,让学生学到"遇到错误时如何反思和调整方向"。相比之下,标准OPD把那些建立在错误前提上的长段推理全部纳入训练,浪费计算资源的同时还引入了有害的训练信号,所以又长又差。

Q3:Relay-OPD和FastOPD都比标准OPD短,两者核心区别是什么?

A:FastOPD是硬截断——固定截掉轨迹的后半段,不管那部分是对是错,也不给学生示范遇到问题该怎么办。Relay-OPD是智能截断加示范——在检测到推理走偏的那一刻才介入,由教师生成几步纠正性内容后就停止,把"如何从错误中恢复"这一能力传授给学生。结果是Relay-OPD不仅轨迹比FastOPD更短,准确率还更高,推理时生成的答案也更简洁。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-