
这项由浙江大学与蚂蚁集团联合开展的研究发表于2026年6月,以预印本形式挂载于arXiv平台,编号为arXiv:2606.06021。研究提出了一种全新的大语言模型知识蒸馏方法,有兴趣深入了解的读者可以通过上述编号查询完整论文。
当我们谈起"让小模型学习大模型"这件事,通常会联想到一个老师和学生的场景。大模型是那个走过千山万水、满腹经纶的老师,小模型是资质不差但还需磨砺的学生。传统的做法是:老师把自己的"考试答案"——也就是每道题选哪个选项的概率——告诉学生,学生照着练。这个方法行得通,但研究团队发现,它有一个根本性的缺陷:老师只给了答案,却从未把自己是怎么思考出这个答案的过程传授给学生。就像一道数学难题,只告诉你最终结果是42,却不解释推导过程,学生也许能背下答案,却永远学不会真正的解题思路。这项研究要做的,正是打破这一惯例,让学生第一次有机会窥见老师真正的"内心世界"。
一、为什么老师只喊答案是不够的
要理解这个问题,得先搞清楚现有的训练方式究竟是怎么运作的。在大语言模型的世界里,"在线政策蒸馏"(On-Policy Distillation,简称OPD)是目前最主流的训练手段之一。所谓"在线",意思是学生自己先生成一段回答,然后拿着这段回答去问老师:你觉得每个位置应该填什么词?老师从自己庞大的词汇表里给出每个词的概率分布,学生就照着这份分布调整自己。这比让学生死记硬背老师的固定答案要好,因为学生是在自己真实产生的语境中学习,更贴近实际使用。
然而,研究团队指出,这种方法在实际运作中存在两个越来越严重的问题。
第一个问题可以用掷骰子来理解。老师拥有一个约十五万个词汇的词典(以Qwen系列模型为例),每次预测一个词,其实是在十五万个选项中做概率分布。最常见的训练方式"采样词蒸馏",每次只看学生实际选了哪一个词,用这单个样本来估算整体的差距。这就好比你想知道一个班级的平均身高,却每次只量一个随机同学,然后就下结论——早期班级里高矮差异很大时,这个估算还算靠谱;但当全班同学的身高越来越接近时,这个单次测量的误差就会主导整个判断,让你的调整方向变得混乱。研究团队在实验中反复观察到,训练初期学生进步飞速,但到了中后期,准确率开始在某个水平附近剧烈震荡,无法继续提升。这正是噪音压过信号的症状。就算换用"Top-K蒸馏",每次看前K个最可能的词,这个根本性的噪音问题也只是被部分缓解,而非消除。
第二个问题更根本,可以把它理解成"信息漏斗"。一个大语言模型内部有几十层"思考层",每一层都会产生一个高维度的隐藏状态向量,编码着模型在那一层对当前语境的理解——哪些概念在激活、哪些关联在形成、推理的方向在哪里。这些信息经过最后一层,被一个叫做"语言模型头"(LM Head)的矩阵压缩映射成词汇表上的概率分布,然后再经过Softmax归一化,最终输出那十五万个词各自的概率。问题是,这个压缩过程是有损的,而且损失极大。不同的内部思维状态完全可能产生几乎相同的输出概率,就像两个厨师用完全不同的食材和工艺,最终端出了味道相近的菜肴。更关键的是,Softmax操作对"整体偏移"不敏感——给所有词的分数统一加一个常数,输出概率丝毫不变。这意味着老师内部隐藏状态里存在大量信息,穿过这个漏斗后就永远消失了,学生完全无从得知。讽刺的是,每次训练时老师已经完整地"想了一遍",那些丰富的中间思维过程全部计算出来了,却在传给学生之前就被丢弃了。
二、一个简单却关键的想法:别看答案,看思考过程
研究团队提出的方案名为"在线表示蒸馏"(On-Policy Representation Distillation,简称OPRD),核心思想出人意料地简洁:既然老师的内心思考比最终答案包含更多信息,为什么不直接监督学生的"内心思考"呢?
具体来说,仍然是学生先生成一段回答,仍然是把这段回答同时喂给老师和学生各自计算一遍。不同的是,OPRD不再关心老师最终输出的词汇概率,而是直接比较老师和学生在变换器内部每一层产生的隐藏状态向量。通俗地说,老师在处理这段文字时,每一层"思考层"都会产生一个代表当前理解的"思维向量",OPRD的目标就是让学生在同样的层、同样的位置,产生尽可能接近的"思维向量"。
训练目标是一个归一化的均方误差损失——可以理解为测量两个向量之间的"空间距离",距离越小代表思维越接近。老师的向量被当作固定目标,不会随训练更新;学生则通过调整自己的参数,努力让自己的思维向量靠近老师的。这个过程完全绕过了语言模型头,不需要计算那个庞大的十五万维词汇概率张量,更不需要做昂贵的Softmax运算。
这个方案有两个可调节的旋钮。一是选择监督哪些层:可以只盯住最后一层,也可以盯住所有层,或者只看偶数层奇数层;二是选择监督哪些位置:可以监督回答的所有词,也可以只监督前几个词或后几个词。研究团队经过细致的实验后发现,对于数学推理这类需要长链条思考的任务,最有效的策略是监督所有层、但只看每个回答的最后两千个词(即回答的结尾部分)。为什么是结尾?下文会细说。
当学生和老师的模型结构完全相同时,可以直接比较各层的隐藏向量,无需任何额外操作。当两个模型的隐藏层维度不同时,只需在学生一侧加一个小小的线性变换层,把维度对齐后再比较,参数量相对整个模型来说微乎其微。
三、理论告诉我们,这不只是工程技巧
研究团队不满足于工程上的改进,他们在理论层面证明了OPRD为什么从根本上优于输出空间的蒸馏。
关于噪音问题,他们证明了一个干净的定理:在给定了学生的当前回答之后,OPRD的梯度是完全确定性的,没有任何随机波动,条件方差为零。相比之下,采样词OPD的梯度在数学上等价于一种叫做REINFORCE的强化学习估计器,其中每个位置采样的那个词相当于一个"奖励信号",而这类估计器的噪音从一开始就存在,并且随着训练进行、学生越来越接近老师时,信号强度以平方速度衰减,而噪音只以线性速度衰减,导致信噪比(信号强度除以噪音强度)线性趋向零。形象地说,这就像你在嘈杂的地铁里听老师讲课,早期声音很大能听清,后来声音越来越小最终被噪音淹没,你只能凭着噪音乱猜。OPRD则永远是在安静的教室里,老师的声音一直清晰可辨。
关于信息漏斗问题,他们证明了语言模型头的有效零空间不为空——存在一整类隐藏状态的差异方向,经过这个投影后完全消失,使得两个内部思维相差甚远的模型在输出层看起来毫无差别。而且,沿着语言模型头奇异值最小的方向,内部状态可以偏离到任意大,对应的输出损失却几乎不变。对于实际的大语言模型,最大奇异值与最小奇异值之比通常高达十的六次方到八次方,这意味着内部思维偏差被输出损失"看见"的能力极度不均匀,大部分方向根本看不见。更重要的是,对于中间层(不是最后一层),输出损失完全没有任何约束力——任何中间层的任意扰动,只要不改变最终输出,对输出空间的损失函数就毫无影响。OPRD则在每一层直接施加约束,把那些被漏斗过滤掉的信息全部纳入监督范围。
四、模型背后的代价:学习的时候脑子里在算什么
OPRD还带来了一个令人惊喜的副产品:它比所有基于输出空间的方法都更省钱。
理解这一点需要知道,计算十五万个词的概率需要在内存里存储一个形状为"批次大小×序列长度×十五万"的巨大张量。以实验配置为例,批次大小8、最大序列长度16384,Top-16蒸馏在这一步会占用约45GB的峰值内存,Top-1蒸馏也需要30GB。而OPRD完全跳过了这个步骤,只需要存储各层的隐藏向量(维度1536),峰值内存仅20.5GB,比Top-16蒸馏节省了54%,比Top-1蒸馏节省了32%。
时间上的差距同样显著。在8张A100(80GB)GPU组成的集群上训练500步,Top-1和Top-16蒸馏都需要约813分钟,而OPRD只需563分钟,快了44%,即速度提升了1.44倍。两种输出空间方法耗时几乎相同,说明瓶颈就在那个庞大的词汇张量计算上,而不在Top-K的筛选操作本身。
在节省下来的20-25GB内存空间里,用户可以在相同的硬件预算下选择使用更大的批次,或者处理更长的上下文,这在实际部署中具有相当实际的价值。
五、实验:学生真的追上老师了吗
研究团队选择了数学竞赛题作为测试场景,这是目前公认的衡量模型深度推理能力的高难度基准。教师模型是JustRL-1.5B,学生模型是DeepSeek-R1-Distill-Qwen-1.5B,两者都基于Qwen2.5-1.5B骨架,拥有相同的28层结构和1536维隐藏层,因此可以直接对比隐藏状态,无需额外的维度对齐层。训练数据来自DAPO-Math-17K数学提示数据集,学生每个提示生成两条回答,最大生成长度16384个词。
评估指标是Avg@16,即每道题随机生成16条回答,取平均正确率,在三个竞赛级数学基准上进行测试:2024年美国数学邀请赛(AIME24,30题)、2025年美国数学邀请赛(AIME25,30题)、以及国际人工智能数学奥林匹克验证集(AIMO,83题)。
未经任何额外训练的原始学生模型,在三个基准上的得分分别为32.9、21.9和62.2,而教师模型的得分为50.8、35.6和79.5,差距相当明显。经过传统的采样词蒸馏(OPD Top-1)训练后,学生在AIME24达到42.3,在AIME25达到33.5,在AIMO达到77.0,有所提升但仍距教师有明显差距。换成Top-16蒸馏,AIME24进一步提升至47.1,但AIME25只略升至34.0,AIMO甚至略降至76.5——更多的输出信息并没有带来一致的进步,这与理论预测的噪音主导问题相吻合。
OPRD的结果则截然不同:AIME24达到49.8,AIME25达到34.6,AIMO达到79.1。与最强的输出空间基线相比,分别提升了2.7、0.6和2.1个百分点,而AIMO的79.1与教师的79.5相差仅0.4个百分点,完全落在16样本评估的正常波动范围内,可以认为学生已经与教师打成平手。
更能说明问题的是训练过程的曲线形态。两种OPD基线都在最初的几十步内快速爬升,然后进入一个平台期,此后基本不再提升,甚至出现震荡。OPRD的曲线则几乎单调上升,从头到尾保持稳定的进步节奏,直到逼近教师水平。这正是理论预测的两阶段分化现象在实验中的直接体现。
除了准确率,研究团队还观察到一个有趣的现象:经过OPRD训练的学生,平均回答长度约5700个词,而两种OPD方法训练的学生都稳定在约7000个词。OPRD不仅准确率更高,还让模型学会了用更简洁的推理过程得出正确答案,不再需要冗长的试探性叙述。这意味着部署OPRD训练模型的推理成本也更低。
与此同时,研究团队追踪了学生与老师在OPRD监督位置上的隐藏状态余弦相似度。这个指标从训练开始时的约93%急速爬升,在前一百步内就越过97%,随后继续缓慢上升,最终趋近于100%。这证明OPRD确实在有效地优化它声称要优化的目标,内部表示对齐的持续改善直接驱动了外部准确率的持续提升。
六、回答的结尾为什么比开头更值得关注
前面提到,研究团队选择只监督回答的最后两千个词,而不是整段回答。这个选择来自一个精细的实验观察,值得单独讲清楚。
在开始正式训练之前,团队对原始学生和教师模型做了一次系统性检查:在学生生成的回答上,分别计算"前K个词"和"后K个词"的师生最后一层隐藏状态余弦相似度,作为K的函数。结果揭示了一个鲜明的模式:前K个词的相似度在K等于50时就已经达到94%以上,到K等于1600时高达97.69%,说明回答开头部分(跟随提示的格式引导、推理链的铺垫)两个模型已经高度一致,几乎没有改进空间。后K个词的相似度则从K等于50时的91.65%起步,在整个中间范围内始终比前K个词低4个百分点以上,直到K接近回答总长才两者重合。几乎所有的师生思维差异都集中在回答的结尾——那正是推理链收束、模型最终提交答案的地方。
这个发现直接解释了为什么仅监督最后2000个词就能获得完整的提升效果:OPRD的监督信号精准落在差异最大、最需要改正的位置,而不是被前半段的"已经对了"部分稀释。用有限的计算预算做最有效的干预,这是OPRD设计中一个颇为精妙的工程洞察。
七、OPRD能和传统方法叠加使用吗
研究团队还测试了将OPRD叠加在现有OPD训练之上,而不是完全替代它。具体做法是设置一个混合权重μ,总损失等于OPD损失加上μ倍的OPRD损失,测试μ分别为0、1和10时的效果。
结果呈现出一个单调递增的规律:μ等于0即纯OPD Top-1,AIME24得分42.3;μ等于1加入轻量OPRD,得分跃升至47.7,已经超过了单独使用Top-16蒸馏的47.1;μ等于10进一步强化OPRD,得分达到50.2,距离教师的50.8仅差0.6个百分点。这种单调性说明OPRD提供的信息与OPD提供的输出层信息是互补而非重叠的,两者叠加使用比任何单独方法都更强,且对混合权重的具体数值不敏感,无需精细调参。
追踪这些复合训练过程的内部诊断指标,可以看到一幅一致的机制图像。策略梯度损失曲线在训练中段都会出现一个尖锐的"峰值",研究团队推测这对应于学生策略的某种相变——一次快速的内部重组。加入OPRD后,这个峰值提前出现,μ越大越早,说明隐藏状态监督加速了学生的内部重组过程。相变过后,所有运行的策略梯度损失都收敛到接近零,但准确率的差距依然存在,这正好印证了信息漏斗理论:当输出层信号已经饱和时,隐藏状态层面仍有剩余差距需要弥合,而只有OPRD能看见并纠正这部分差距。
对Top-16重叠率(学生和教师各自排名前16的词汇集合的交集大小)的追踪也呈现相同模式:纯OPD Top-16在中后期增速明显放缓,而叠加OPRD后,中期出现与相变对应的短暂下沉,随后反弹并超越纯OPD轨迹,最终达到更高的师生词汇一致性。表示层对齐的改善,最终传导回输出层指标的改善,两个层面的监督并非相互替代,而是相互增强。
八、这个方法有没有局限,未来能走多远
OPRD并非没有限制,研究团队对此非常坦诚。最主要的约束是同架构要求:OPRD目前只能在架构完全相同的师生对之间使用,也就是层数、宽度和参数初始化家族都需一致。当两个模型大小不同时,即便共享同一个词汇表,它们的隐藏状态也几乎正交——用一个大模型的思维向量强制对齐一个小模型,后者会被迫抛弃自己的已有知识去迎合一个毫无结构相似性的目标,反而更糟。相比之下,输出空间方法虽然也存在容量不匹配问题,但至少两边都是概率分布,有共同语言;隐藏状态则完全缺乏这种天然的共同单位。因此,本研究严格限定在同架构场景下。
不过,研究团队也指出了若干高价值的应用场景,即便在同架构约束下也具有相当的实用价值。在大规模强化学习流水线中,越来越多的系统会合并多个奖励模型或策略检查点为一个单一模型,这类场景中全词汇OPD的内存消耗极为夸张,Top-K又重新引入方差问题,OPRD提供了第三条路:内存随隐藏层维度而非词汇量增长,梯度完全确定性。在"在线自蒸馏"场景中,教师和学生使用完全相同的模型权重,只是教师接受了额外的特权信息(比如标准答案、分步验证信号),两者天然同架构,OPRD可以作为输出空间反向KL的直接替代品。
关于未来方向,研究团队提出了若干值得探索的路径。跨架构蒸馏是最具挑战性的延伸,可能需要对比学习目标或相对几何对齐,而非绝对向量对齐。自适应层和位置选择可以取代当前简单的"所有层+最后K个词"策略,根据实际师生差距动态分配监督资源。注意力图蒸馏是另一个尚未触及的维度,OPRD只对齐了隐藏状态向量,并未约束产生这些向量的注意力模式,两者原则上提供互补的结构信息。最后,研究团队指出,对训练中观察到的"相变"现象的深入理解,以及对OPRD收敛速度与OPD收敛速度的定量对比分析,都是值得进一步建立理论基础的方向。
说到底,这项研究做了一件看似简单却意义深远的事:把AI模型之间的知识传递,从只看"最终答案"推进到了看"思考过程"。老师已经把完整的推理过程算出来了,之前却在传给学生之前把它丢掉——OPRD只是让这份本已存在的计算结果物尽其用。这个改变带来的效果是,在竞赛级数学题上,学生首次真正追上了老师,而不是永远卡在老师水平以下几个点的高原地带。与此同时,它还更快、更省内存,理由同样简单:不再需要计算那个庞大的词汇概率张量了。
这对普通人意味着什么?更好的AI助手、更强的推理能力,以及在相同硬件预算下能部署更强模型的可能性。当然,同架构的限制目前还将其应用范围约束在特定场景,跨模型族的蒸馏仍是一个开放问题。但无论如何,这项研究打开了一扇新的窗口:在师生之间传递的不只是答案,还有思考本身。对这个问题感兴趣的读者,可以通过arXiv编号2606.06021查阅完整论文和代码仓库,代码已在GitHub公开,地址附于论文之中。
Q&A
Q1:OPRD与传统OPD蒸馏方法相比,最核心的区别是什么?
A:传统OPD蒸馏只让学生对比老师输出的词汇概率,相当于只看答案。OPRD则直接对比师生在模型内部每一层产生的"思维向量",相当于让学生学习老师的推理过程本身。这绕过了将内部状态压缩成词汇概率时造成的大量信息损失,同时消除了单词采样带来的梯度噪音。
Q2:OPRD为什么比Top-K蒸馏训练速度快、内存占用少?
A:Top-K蒸馏仍然需要计算学生侧完整的十五万维词汇分数张量,再做Softmax归一化,这个张量在批次大小8、长度16384时就需要约45GB内存。OPRD完全跳过这个步骤,只计算各层隐藏向量的均方误差,内存峰值降至20.5GB,训练速度也因此提升了约44%。
Q3:OPRD是否只能用于数学推理任务?
A:当前论文的实验聚焦于竞赛级数学推理,但方法本身并不局限于此。代码生成、智能体交互、开放对话等任何需要深度推理的任务理论上均可受益,只是不同任务的最优层选择和位置选择策略可能有所不同,仍需进一步验证。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。