
这项由香港科技大学(广州)、星云智力科技与微软研究院联合完成的研究,于2026年7月6日以预印本形式发布于arXiv平台,编号为arXiv:2607.04751。感兴趣的读者可通过该编号在arXiv上查阅完整论文。
**一、当AI学生遇到"高不可攀"的老师**
教育界有一个朴素的道理:当老师和学生的水平差距太悬殊时,直接照搬老师的解法往往会让学生彻底懵圈,效果反而不如循序渐进地学习。这个道理放在人工智能的世界里同样成立,甚至会引发更严重的问题。
当前,训练大型语言模型(也就是像ChatGPT这类能对话、能推理的AI)有一种非常流行的方法,叫做"在线策略蒸馏",英文缩写为OPD。这个方法的核心思想很朴素:找一个更聪明的AI老师,让学生AI不断照着老师的方式来生成文本,哪里偏差就在哪里纠正,久而久之学生AI就会越来越接近老师的水平。
OPD相比两种主流方法都有明显优势。一种叫"监督微调",这类方法的问题是AI训练完容易"好了伤疤忘了疼",把之前学到的东西遗忘掉;另一种叫"强化学习",这类方法虽然不容易遗忘,但奖励信号非常稀疏——就像期末才给成绩的老师,学生平时完全不知道自己做得对不对,导致学习效率低且不稳定。OPD则兼具两者的优点:既像强化学习一样让AI自己生成答案然后反思,又像监督微调一样给出密集、细致的指导信号。
然而在实际训练中,OPD有一个致命的软肋,这正是这篇论文要解决的核心问题。
**二、"老师打了零分":OPD为什么会崩溃**
要理解OPD的症结所在,需要先了解它是怎么运作的。在训练过程中,学生AI会自己生成一段文字,然后逐个词地与老师AI进行比较:老师觉得这个词出现在这里的概率有多大?学生自己给这个词多大的概率?两者相除(取对数后)就得到一个"即时奖励"信号,告诉学生"你选这个词选得对不对"。
问题就出在这个比较上。当学生AI生成了一个老师认为完全不应该出现的词时,老师给这个词的概率趋近于零,而学生自己给了它一个不小的概率。一旦用极小的数去除一个较大的数,再取对数,结果就会趋向负无穷——用大白话说,就是惩罚信号无限大。
以一个具体场景来理解:假设学生正在解一道数学题,老师认为解题的第三步应该写"所以",概率高达99%;但学生却写了"因此",老师认为写"因此"的概率只有0.001%。于是惩罚信号就变成了log(0.001%) = -6.9,这已经是一个很大的负数。现在假设老师认为某个词出现的概率是0.000001%,惩罚就变成了log(0.000001%) = -13.8。如果老师几乎完全不可能用某个词,惩罚就会趋向负无穷大。
这就好比一位学生在考试中偶然写错了一个字,老师不是扣一两分,而是直接判定这份试卷作废、罚学生从头开始学ABC。这种"一刀切的极端惩罚"会让整个训练过程变得极度不稳定:梯度(可以理解为"告诉AI往哪个方向调整参数的指南针")会发生剧烈抖动,模型参数会乱跳,最终导致AI学得一塌糊涂。
研究者们之前也尝试过一些补救措施,比如把老师和学生混在一起采样、给奖励信号加个上限截断、调整采样参数、先用离线数据"预热"模型等。但这些方法都是治标不治本的经验性技巧,没有从根本上解释和解决"惩罚信号无界"这个数学本质,也缺乏理论保证。
**三、"渐进式家教":TOP-D的核心思想**
这篇论文提出的解决方案叫做"信任域策略蒸馏",英文缩写为TOP-D。它的灵感来自一个非常朴素的教育智慧:如果学生跟不上顶尖老师,不要直接让学生对标顶尖老师,而是先给学生安排一个"稍微比他强一点"的辅导老师,等学生进步了,辅导老师的标准也随之提高,如此循环渐进。
TOP-D将这个思想转化为一个精确的数学操作,称为"构建近端老师"。具体来说,不再直接用真正的老师AI(称为目标老师)给出的概率分布来指导学生,而是把目标老师的概率分布和当前学生的概率分布按一定比例混合,得到一个中间态的"近端老师"。
用公式表达就是:近端老师在某个词上的概率 = α × 目标老师的概率 + (1-α) × 学生当前的概率。这里α是一个0到1之间的参数,控制混合的比例。
这个操作的神奇效果立刻体现在奖励信号上。原来的OPD奖励是log(目标老师概率/学生概率),当目标老师概率趋近于零时会爆炸;而TOP-D的奖励变成了log(α×目标老师概率/学生概率 + 1-α)。数学上可以严格证明,无论学生给某个词的概率多高,无论目标老师给这个词的概率多低,这个新的奖励永远不会低于log(1-α)。当α=0.1时,最低惩罚是log(0.9) ≈ -0.105,完全可控。
论文中有一张非常直观的图:横轴是"目标老师概率/学生概率"的比值,纵轴是奖励值。OPD的奖励曲线在比值趋近于零时直接掉向负无穷,像一条断崖;而TOP-D的奖励曲线在底部被一条水平线"兜住",像给悬崖底部铺了一张安全网。不同的α值对应不同高度的安全网,α越小,安全网越高,训练越稳定。
这里有一个非常重要的细节:构建近端老师只是一个概念上的操作,实际计算时并不需要真的把两个模型的概率混合起来再计算奖励。数学推导表明,最终的奖励公式可以直接从目标老师的对数概率和学生的对数概率算出来,没有任何额外的计算步骤,也没有任何额外的计算量。这意味着TOP-D是真正意义上的"零额外成本"改进。
**四、"反复练习":内部信任域迭代**
解决了奖励信号不稳定的问题后,TOP-D还顺手解决了OPD的另一个痼疾:数据利用率极低。
标准OPD采用严格的"在线"模式:学生生成一批答案,用来更新一次参数,然后这批答案就永远丢弃了,再生成新一批答案,再更新一次参数……这就像学生做完一套练习题就立刻扔掉,永远不会回头复习,每次都要现场临时做题来学习,效率非常低。
TOP-D借鉴了强化学习中已经被广泛验证的"信任域"技术(具体是类似PPO算法的思想),允许用同一批数据更新多次参数。关键在于引入了一个"重要性采样比":每次用旧数据更新参数时,计算一下"如果是当前的学生来生成这道题的答案,概率会与生成这批数据时的旧学生相差多少",然后用这个比值来补偿数据"过时"带来的误差,同时用截断(clip)操作防止这个补偿比值偏离太远导致不稳定。
具体实现上,每次从题库里抽一批题目,让当前学生(暂时冻结参数,称为"行为策略")生成8个回答,然后这批数据会被分成多个小批次,模型参数在这些小批次上反复更新多轮,才进行下一次数据采样。全局批次大小为512道题(4096个样本),小批次大小为32道题(256个样本),也就是同一批数据被循环使用了16次。
在计算每个词的"优势"(即这个词选得好还是不好的量化评分)时,TOP-D还引入了一个精心设计的"词级别奖励"。对于回答中第k个词,它的奖励不仅包含该词本身的即时奖励,还加上后续所有词的奖励取平均(经过长度归一化)。这个设计让模型既不会偏向生成极短的答案(因为短答案后续奖励少),也不会无限拉长答案(因为奖励会被平均稀释)。最后,一组回答中所有词的奖励统一做标准化处理(减均值除标准差),让不同难度题目之间的信号更具可比性。
**五、理论保证:为什么这样设计一定有效**
研究团队不满足于仅凭经验展示效果,而是从数学层面严格证明了TOP-D的三重保证,形成一个完整的理论闭环。
第一重保证是"梯度方差有界"。在标准OPD中,当奖励信号可以趋向负无穷时,梯度的方差也会趋向无穷大——用一个形象的比喻来说,指南针的抖动幅度可以大到无法使用。论文证明,引入近端老师后,TOP-D的梯度方差被严格控制在一个有限的上界以内:Var(梯度) ≤ M?×词汇量×max{(log(1-α))?, C*α},其中M是模型参数梯度的上界,C*是一个由数学推导确定的常数。当α趋近于0时,方差趋近于0(稳定性极高);当α等于1时,这个界退化为无穷大,正好对应标准OPD的不稳定性。α在这里扮演了一个精确的"方差调节旋钮"的角色。
第二重保证是"全局收敛性"。论文把近端老师的构建过程抽象为一个数学算子T:T(π) = α×目标老师 + (1-α)×当前学生。每一步迭代中,学生尝试逼近近端老师,但不可能完全做到(存在优化误差ε)。论文证明,在这个框架下,经过k步迭代后,学生与目标老师的距离满足:d(π_{k+1}, π*) ≤ (1-α)^{k+1} × d(π_0, π*) + Σ(1-α)^{k-i} × ||ε_i||。这个不等式有两层含义:其一,初始的差距会以指数速度衰减,就像早期的错误会被自然"遗忘";其二,长期来看,学生与目标老师的距离上界是ε∞/α,其中ε∞是优化误差的长期水平。这意味着只要能把每一步的优化误差控制得足够小,最终就能无限逼近目标老师。
正是这个"ε∞/α"的结论,在理论上点明了引入内部信任域迭代的必要性:如果能通过多步迭代把每步的优化误差压得更小,整个算法就能更接近理想效果。
第三重保证是"单调改进"。这部分论文证明,内部信任域迭代能够保证每一步更新后,真实目标值(期望累积奖励)是单调不下降的。具体来说,论文推导出一个下界:η(π) ≥ ζπ(π) - 2ξT_max l_π × E[DTV(π, π)],其中ζπ(π)是"代理目标"(用当前学生的状态分布来估算新策略的期望回报),DTV是两个策略在每个状态下动作分布的"全变差距离"(可以理解为两个策略的选择有多不同),ξ是期望优势的最大绝对值,T_max是最大生成长度,l_π是平均回答长度。由于η(π) = Mπ(π)(当新策略就是旧策略时,下界等于真实值),任何能提升下界的更新必然也能提升真实目标,从而保证单调改进。结合Pinsker不等式(一个连接KL散度与全变差距离的数学工具),可以进一步证明:只要把每步的KL散度(两个策略差异程度的另一种度量)控制得足够小,优化误差就能被严格控制在预设范围内,从而紧密闭合了"ε∞/α"这个收敛上界。
这三重保证形成了一个完整的理论闭环:近端老师控制方差→梯度稳定→收敛分析指出需要控制每步误差→内部信任域迭代保证单调改进并压缩每步误差→最终整个算法收敛。
**六、实验数据:在最难的数学题上的表现**
理论固然重要,但实验结果才是最有说服力的"成绩单"。研究团队在数学推理这个被业界公认为极具挑战性的领域进行了系统性测试。
训练数据使用了一个叫做DAPO-Math-17k的高质量数学推理数据集,包含17000道数学题。评测基准主要使用了AIME系列竞赛题(美国数学邀请赛,这是高中数学竞赛中难度相当高的一类)以及AMC(美国数学竞赛)和其他数学基准。评测指标采用avg@32,即模型对每道题生成32个答案取平均正确率,这种方式能比较准确地反映模型的真实数学能力。
学生模型使用了两个版本:一个是参数规模较大的Qwen3-8B-Base(约80亿参数),一个是较小的Qwen3-1.7B-Base(约17亿参数)。老师模型主要使用Qwen3-30B-A3B-Instruct-2507,这是一个混合专家架构的大模型(总参数30B,激活参数3B),数学能力显著强于学生。
以8B学生配合这位"顶尖老师"为例,结果相当令人印象深刻。在AIME24这个基准上,原始未训练的学生模型得分9.38%;经过强化学习(GRPO方法)训练后提升到30.10%;经过更先进的强化学习(DAPO方法)训练后达到32.92%;而标准OPD方法训练的结果却只有24.58%,不仅低于两种强化学习方法,甚至还输给了简单的GRPO——这充分说明了标准OPD的不稳定性问题有多严重。TOP-D方法训练后,得分达到50.42%,比标准OPD高出整整25.84个百分点,比最强的强化学习基准DAPO也高出约17.5个百分点。
在AIME25和AIME26这两个更新、题目没有在训练数据中出现过的基准上,TOP-D同样保持了明显的领先:AIME25上34.06% vs OPD的23.33%,AIME26上44.06% vs OPD的25.42%。在AMC23和MATH-500等相对容易一些的基准上,TOP-D也分别达到88.13%和91.23%的avg@8准确率,均优于所有对比方法。
当换成更小的1.7B学生时,差距体现得更为明显。小模型与顶尖老师之间的能力鸿沟更大,标准OPD在AIME24上只能得到8.96%,甚至低于原始模型训练前的GRPO基线(10.52%),说明大能力差距下OPD的不稳定性更加致命。TOP-D则以20.31%的成绩,相比标准OPD高出11.35个百分点,而且还超越了两种强化学习基准。换成能力稍弱一些的Qwen3-14B作为老师时,TOP-D同样明显优于标准OPD(12.81% vs 7.81% on AIME24)。
**七、拆开看:每个设计选择为什么重要**
为了验证TOP-D的每个组成部分都是必要的,研究团队对1.7B学生做了一系列对照实验。
第一组对照:把α设为1.0,也就是去掉近端老师,直接退化为标准OPD。训练曲线显示高度不稳定,剧烈抖动,最终性能远低于TOP-D。这验证了近端老师对稳定训练至关重要。
第二组对照:保留近端老师但去掉内部信任域迭代(标注为"w/o off-policy"),每次采样的数据只用一次就丢弃,回到严格的在线训练模式。结果是训练收敛速度明显变慢,需要更多步骤才能达到相同的性能水平,体现出数据重复利用对样本效率的重要贡献。
第三组敏感性分析:保持其他设置不变,分别测试α=0.1、0.2、0.3三个值。结果显示三条学习曲线非常接近,最终性能差异很小,说明TOP-D对这个关键超参数的选择不敏感,不需要精细调参就能稳定工作。论文最终选择α=0.1或0.2作为默认设置。
在计算资源方面,所有实验在配备NVIDIA H200 GPU的服务器上进行,标准配置是4个节点共32张GPU。不过论文特别说明,单个8张GPU的节点就可以完整复现所有结果,具有较好的可访问性。
**八、留白与展望:这项研究还没回答的问题**
论文也坦诚地承认了当前工作的局限性。目前所有实验的学生模型都在8B参数以内,更大规模(比如30B以上)的学生模型是否同样受益,尚未验证。不过研究团队基于理论分析对此持乐观态度。
另一个局限是训练步数相对较少,8B学生只训练了约200-400步,1.7B学生同样如此(RLVR基线训练了更多步)。令人期待的是,在这个训练窗口内完全没有看到性能饱和的迹象,意味着继续训练可能还有相当大的提升空间。当然,训练数据也目前只用了数学推理这一个领域,是否在代码、科学推理、通用对话等其他领域同样有效,也是值得探索的方向。
说到底,TOP-D做的事情用一句话就能概括:它给AI学生和顶尖AI老师之间搭了一个"临时辅导老师"的中间层,让学生不再直面过于悬殊的差距,训练过程因此从高度不稳定变得平滑可靠。这个做法不引入任何额外的计算开销,只需要一行数学变换就能实现,却在最难的数学推理任务上带来了高达25.84%的绝对精度提升。它既有完整的理论支撑(三重数学保证形成闭环),又有扎实的实验验证(跨模型规模、跨老师能力、跨基准集均表现稳定),是一个理论与实践都颇为完整的研究工作。
对于AI大模型的训练来说,找到一种既稳定又高效、既有理论保证又没有额外成本的改进方法,是非常有价值的贡献。随着基础模型能力持续快速提升,蒸馏训练面临的"老师太强学生跟不上"的问题只会越来越突出,TOP-D这类解决方案的重要性也会随之提升。有兴趣深入了解数学推导细节的读者,可以通过arXiv:2607.04751查阅完整论文及附录中的详细证明过程。
---
Q&A
Q1:TOP-D和普通OPD蒸馏方法的本质区别是什么?
A:普通OPD让学生AI直接对标顶尖老师AI,当两者差距太大时,惩罚信号会趋向负无穷,导致训练崩溃。TOP-D通过将目标老师的概率分布和学生当前概率分布按比例混合,构建一个"近端老师",把惩罚信号的下界严格锁定在log(1-α),彻底避免了信号爆炸。实际计算时这只是一个简单的数学变换,不增加任何计算量。
Q2:TOP-D在AIME数学竞赛题上能提升多少准确率?
A:在AIME24基准上,用Qwen3-8B模型配合Qwen3-30B-A3B-Instruct-2507作为老师,标准OPD方法的avg@32准确率只有24.58%,TOP-D达到了50.42%,绝对提升25.84个百分点。在AIME25和AIME26上,TOP-D分别达到34.06%和44.06%,同样大幅领先标准OPD的23.33%和25.42%。
Q3:TOP-D训练AI需要多少计算资源?
A:论文中的实验使用了配备NVIDIA H200 GPU的服务器,标准分布式训练用4个节点共32张GPU来加速实验迭代。但研究团队特别强调,单个8张GPU的标准服务器节点就可以完整复现所有训练结果,具有较好的可及性,不需要超大规模的计算集群。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。