微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 韩国FuriosaAI等机构揭秘:AI模型蒸馏训练为何越"懒"越快,"过期数据"到底能用多久?

韩国FuriosaAI等机构揭秘:AI模型蒸馏训练为何越"懒"越快,"过期数据"到底能用多久?

2026-07-03 09:49
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-03 09:49 科技行者

这项由韩国AI芯片公司FuriosaAI联合韩国亚洲大学、加州大学伯克利分校、微软研究院、KRAFTON及Ludo Robotics共同完成的研究,以预印本形式发表于2026年6月23日,论文编号为arXiv:2606.24143,感兴趣的读者可通过该编号检索完整论文。

**一、故事的起点:一个被忽视的效率难题**

在AI大模型的训练流水线里,有一个长期存在却鲜少被认真对待的矛盾。每当工程师们想让一个聪明的大模型(老师)去指导一个规模更小、更轻量的模型(学生)学习推理和解题时,这套被称为"在线策略蒸馏"(On-Policy Distillation,简称OPD)的训练方式,总会遭遇同一个瓶颈:老师必须等学生先做完一整批题目,然后逐题给出反馈,学生才能根据这些反馈更新自己的能力——接下来,一切重新开始。

这就好比一名家教老师和学生约好了每次只批改学生当堂做出来的题,批改之前不能开始下一轮练习,批改之后学生必须重新出发。问题在于,这个学生解题的速度极慢——尤其是那些需要长篇推导的数学或编程题,有时一道题就要写几千字的过程。于是,老师批改完这批题准备好反馈的时候,学生已经无事可做地等了很长时间,整个学习流水线有大量时间处于空转状态。

在真实的AI训练中,"学生做题"对应的是GPU集群生成模型输出(称为"rollout",即推理展开),"老师批改"对应的是另一个大模型对这些输出逐词给出概率反馈(称为"teacher scoring",教师打分),而"学生更新能力"对应的是模型参数的梯度更新(称为"learner update",学习器更新)。这三个步骤在传统的同步训练框架中必须串行完成,任何一步拖慢都会让整条流水线停下来等待。

异步训练的思路是:能不能让学生一直在做题、老师一直在批改、参数更新也一直在进行,三者互不等待、并行推进?这就像把一个串行流水线改造成工厂的流水作业线——不同工序同时运转,整体产能大幅提升。

然而,这里藏着一个麻烦:当学生在某一时刻更新参数时,它所用的"练习题答案"和老师的"批改意见",都是几轮参数更新之前的"旧版学生"生成的。换句话说,真正在被训练的学生,是在用一个"过期版本的自己"的题目本来学习。这些"过时数据"究竟会造成多大的伤害?又该怎么减轻这种伤害?这就是这项研究试图系统性地回答的问题。

**二、两种不同的"打分方式",面对过期数据的命运截然不同**

要理解这项研究的核心发现,先要了解老师给学生反馈的两种主要方式。在数学上,这两种方式分别被称为"前向KL散度"和"反向KL散度",但不需要被这些术语吓到——用一个具体比喻来理解就很清晰。

假设老师手里有一张"理想答题分布地图",标注了在面对某个问题时,每种可能的回答方式有多大概率是最优的。老师有两种方式来纠正学生:第一种是以自己为中心,检查自己认为重要的每种答法,学生对这些答法的掌握情况如何——这就是前向KL,老师主导、用老师的眼光衡量;第二种是以学生为中心,检查学生自己倾向于写出哪些答法,这些答法在老师眼中是否恰当——这就是反向KL,学生主导、用学生的实际行为衡量。

现在,当训练进入异步模式、数据开始"过期"时,这两种方式的脆弱程度就产生了本质区别。

在异步训练中,"学生的答案本子"和"老师的批注本子"都是根据某个旧版本的学生生成的,记录的是那个旧版学生写下的词汇,以及老师对那些具体词汇的评分。到了实际执行参数更新时,真正的学生已经更新了好几轮,它的思路和词汇选择都已经发生了变化。

对于前向KL来说,无论学生如何变化,它关心的始终是老师认为重要的那些词汇,而老师的评分在批注本里是不变的,学生只需要看这些词汇在自己当前的参数下概率如何,调整就好了。因此,即使数据"过期"了很久,前向KL依然能正常工作,因为它的核心需求——老师对特定词汇的评分——始终保存完好。

对于反向KL来说,情况就麻烦得多。反向KL关心的是当前学生自己会选择的词汇,而当前学生的词汇选择随着参数更新已经改变了。批注本里记录的是旧版学生选的词,老师也只对那些旧词给了分——如果当前学生更偏向于写一些新的词,而批注本里压根没有这些新词的老师评分,反向KL就会出现"找不到参考分数"的困境,训练信号严重失真。

研究团队用FuriosaAI自研的实验框架,在Qwen3-4B-Base(40亿参数的学生模型)和Qwen3-30B-A3B-Instruct-2507(300亿参数的老师模型)之间,系统地测试了将数据"过期程度"从0批次(同步、新鲜)逐步增加到128批次的情况。评测指标是最终模型在AIME 2024、AIME 2025(美国高考竞赛数学题)和AMC 2023(美国数学竞赛)上的准确率。

结果非常清晰:在数据完全新鲜时,反向KL表现略好于前向KL;但随着过期程度增加,反向KL的准确率直线下滑,而前向KL则保持相当平稳。到数据过期64至128批次时,前向KL的表现已经明显优于反向KL。这个发现有重要的实践意义——如果工程师选择使用前向KL来做在线蒸馏,异步化训练几乎不需要任何特殊处理;但如果选择了反向KL(它在某些指标上零延迟时性能更好),就必须认真对待数据过期带来的问题。

**三、如何修复反向KL对过期数据的脆弱性:一个聪明的"重算技巧"**

确认了反向KL更脆弱之后,研究团队开始探寻解决方案。他们首先想到的是借鉴强化学习(RL)领域已有的异步训练稳定化技术——因为反向KL在数学形式上可以被改写成一个类似强化学习"策略梯度"的形式,从而套用那套语言框架来分析和改进。

在这个框架下,"优势值"(advantage,简写A)是一个衡量某个词选得好不好的分数:具体来说是老师给这个词的评分减去学生自己对这个词的评分的对数,正值意味着老师比学生更喜欢这个词,负值则相反。问题是,在数据过期的情况下,这个优势值应该用旧版学生的参数来算,还是用当前最新学生的参数来重新算?

另一个关键选择是要不要使用PPO裁剪(PPO clipping)——这是强化学习中一种著名的稳定训练的手段,其核心思想是限制每次参数更新的幅度不能太激进,就像开车不能猛踩油门一样。

研究团队设计了一个二乘二的对照实验:优势值用旧的(A_old)还是用当前重算的(A_theta),与是否使用裁剪两两组合,形成四种方案,在不同过期程度下全部测试。

结果出人意料地直接:用当前参数重算优势值、同时不使用裁剪,这个组合在几乎所有过期程度下都是最好的。而机械地套用强化学习惯例——用旧优势值加裁剪——虽然在中等过期程度下还算稳定,但在高过期程度时也会大幅下滑。

为什么重算优势值能起作用?研究团队进一步查看了训练过程中一个关键指标——"重要性权重"(即当前学生概率和旧学生概率之比ρ_theta)的99百分位数。这个数越大,说明当前学生和旧学生的行为差异越大,训练越不稳定。实验发现,用当前参数重算优势值后,这个99百分位数的峰值就自然压低了,说明重算过程本身就隐式地起到了类似裁剪的稳定化作用——所以额外加裁剪反而会砍掉有用的梯度信号。

研究团队还专门测试了两种更先进的异步强化学习稳定化方法:来自AReaL系统的"解耦PPO"(Decoupled PPO)和来自M2PO的"二阶矩约束"方法。这两种方法在强化学习场景下都被证明能改善过期数据的训练稳定性。结果显示,在在线蒸馏场景下,它们都没能超过"重算优势值、不裁剪"这个简单得多的方案。这说明,在线蒸馏有其特有的结构,使得那些为强化学习量身定制的工具并不能直接迁移过来产生额外收益。

**四、老师的"评分本"装不下所有词:稀疏缓存带来的新挑战**

到这里,研究团队已经解决了"用哪种优势值"的问题。但还有另一个更底层的麻烦没有触及——老师的评分本身是怎么保存的。

完整地保存老师对所有可能词汇的概率分布,在工程上代价极高。一个大语言模型的词汇表通常有几万甚至十几万个词,每个解码位置都要传输和存储这么多浮点数,在异步流水线中会产生巨大的通信和存储开销。因此,实际系统通常只保存一小部分老师的评分——要么是老师概率最高的前K个词(称为"稀疏Top-K"),要么是采样一个或几个具体的词(称为"蒙特卡洛采样",MC)。

当这份"有限评分缓存"遇上过期数据,就出现了一个新的问题:旧版学生认为重要的那些词和当前学生认为重要的词,可能并不一样。以稀疏Top-K为例,旧版学生最可能写"is"这个词,所以缓存里有老师对"is"的评分;但当前学生经过几轮更新,现在最可能写"was",而缓存里根本没有老师对"was"的评分。这种"支持集不匹配"的问题,会让反向KL的训练信号永久性地缺失一块,无法通过任何重新加权的技巧来弥补——因为缺失的信息根本不在缓存里,重新加权只能在已有的词上做文章。

相比之下,蒙特卡洛采样的方式则有一种数学上的"可修复性"。当旧版学生随机采样了词a,并记录了旧版概率p_old(a),后来我们可以用"重要性采样"(importance sampling)的技巧,把"从旧学生角度采样"的期望值,数学上等价地转换为"从当前学生角度"的期望值——做法是给每个词乘以一个修正系数(当前概率除以旧概率)。这种转换在数学上是精确无偏的,前提是旧学生的采样覆盖了当前学生真正关心的词。

这个区别在实验中得到了清晰验证。研究团队分别测试了稀疏Top-K和蒙特卡洛采样,对两者分别施加或不施加重要性采样修正,然后在不同过期程度下观察准确率变化。蒙特卡洛加重要性采样的组合随着过期程度增加虽有下滑,但明显比其他方案稳健得多;而稀疏Top-K即便加上了重新加权,也无法弥补支持集不匹配的根本缺陷,性能照样持续下滑。

**五、用"多人同时抄题"来降低随机波动:多样本蒙特卡洛**

蒙特卡洛采样虽然在数学上可以被修正,但有一个实践上的弱点:单次采样的随机性太强,估计出来的梯度方差很大。比方说,如果一个词在旧学生那里被采样到,但这个词在当前学生眼中概率极低,重要性权重就会非常大,产生极端梯度,像驾驶员突然猛踩油门一样,训练就会不稳定。

这一问题的解决方案其实直觉上很简单:与其每个解码位置只采样一个词,不如同时采样多个词,把这些词的修正梯度平均起来,自然就降低了随机性。研究团队把这个方法称为"多样本蒙特卡洛"(Multi-sample MC),记为MCm,其中m是每个位置采样的词数。

这里有一个重要的实现细节值得说明:这里说的"在每个位置采样多个词",并不是让学生从某道题的中途分叉出多条完整的续写路径——那样会把计算量乘以m倍,得不偿失。而是仅仅在每个解码位置局部地采样m个候选词,让老师对这m个词分别打分,然后把这m个词各自的修正梯度取平均。整条生成路径仍然只有一条,增加的只是每个位置"让老师多看几个备选词"的开销。

这种设计之所以在异步蒸馏中特别自然,研究团队给出了一个很有说服力的逻辑:在同步训练里,稀疏Top-K本来就提供了类似"多看几个词"的低方差近似,没有必要再额外采样多份MC样本;但一旦进入异步模式,Top-K的支持集变得过期了、不匹配了,这时候多样本MC就成了在保持可修复性的同时降低方差的最自然选择。

实验数据充分支持了这个设计。在过期程度为128批次的极端场景下,从MC1(每位置1个样本)升级到MC4(每位置4个样本),在AIME24、AIME25、AMC三个测试集上都出现了明显的准确率提升;继续增加到MC16和MC64,收益逐步变小但方向一致。研究团队还专门测量了方差缩减的程度:在单个解码位置层面,MC64相比MC1将方差降低到了约1.49%,非常接近理论上的1/64;即便在将整条序列所有位置的梯度加总之后,MC64仍然将序列级方差降低到了MC1的11.2%左右,实际效果相当显著。

**六、把一切装进真正的异步流水线:AsyncOPD系统**

有了上述对蒸馏目标选择、优势值重算策略和蒙特卡洛缓存设计的系统性分析,研究团队将所有最优选择组合成一个完整的异步训练系统,命名为AsyncOPD,并将代码完整开源。

AsyncOPD的核心是流式异步调度器。相比此前VeRL系统里的"步差调度"(step-off scheduling)——它虽然也让不同阶段有一定程度的重叠,但本质上仍然以固定批次为粒度、批次之间存在等待屏障——AsyncOPD完全打破了批次边界:学生推理工作器持续生成数据、随完随传;老师评分器接收完成的样本立即处理;学习器一旦凑够一个训练批次就立即更新参数;权重同步时推理工作器短暂暂停,但已经生成到一半的句子不被丢弃,而是保留前缀、在更新后的权重下继续生成后半段。整个系统以流水线的方式持续运转,尽可能消除各阶段之间的等待。

为了定量衡量异步程度,研究团队定义了一个"流水线重叠度"(overlap)指标:三个阶段各自实际运行时间之和,除以总的训练墙钟时间。在一个完全串行的同步流水线中,三个阶段不重叠,这个值接近1;最大值为3,意味着三个阶段在全程都同时满负荷运行。

研究团队在一台单节点8块B200显卡的服务器上,分别对Qwen3-1.7B-Base、Qwen3-4B-Base和Qwen3-8B-Base三个规模的学生模型,以及两种缓存设置(MC64和MC1)进行了对比实验,每种配置都包含严格同步、两步差调度和AsyncOPD三种方案,训练100个迭代轮次。

以MC64设置为例:在1.7B模型上,AsyncOPD将训练吞吐量从严格同步的8700 tokens/秒提升到23400 tokens/秒,提速2.7倍,流水线重叠度从0.81提升到2.13,而最终AIME24准确率9.38%反而比严格同步的8.85%还要略好;在4B模型上,吞吐量提升1.66倍,流水线重叠度达到2.19,准确率持平;在8B模型上,吞吐量提升1.94倍,重叠度2.24,准确率从26.56%微升至28.65%。MC1设置下,由于每个样本的缓存开销更小,吞吐量提升幅度更大,最高达到了MC1版本的3.28倍(1.7B模型),准确率同样维持在有竞争力的水平。

研究团队还额外测试了关闭思维链模式(thinking-disabled)的Qwen3 1.7B/4B/8B模型,结果同样显示AsyncOPD在吞吐量和流水线重叠度上均居于最高,在4B模型的MC64设置下最高实现了3.82倍于严格同步的吞吐量,同时准确率与基线保持相当。

**七、说到底,过期数据有多"过期"才是底线**

归根结底,这项研究给出了一个在实践中非常有用的判断框架,帮助工程师决定异步蒸馏该怎么做。

核心结论可以这样来理解:如果选择了前向KL作为训练目标,数据过期带来的性能损耗相当小,系统可以做得非常异步、非常激进,几乎不需要担心数据过时的问题。如果选择了反向KL,三件事必须同时做对:用当前学生参数重算优势值(而不是用旧值)、不要加PPO裁剪、以及使用蒙特卡洛采样而不是稀疏Top-K缓存老师评分,并且在每个解码位置缓存多个(比如4个或16个)候选词来降低估计方差。

值得注意的是,这项研究也坦诚地指出了自己的局限:所有实验都在一台8卡节点上完成,多节点大规模集群的行为有待验证;研究没有覆盖"完整保存老师全词汇概率"的密集KL设置,这种设置可以避免缓存支持集不匹配的问题,但工程实现更难;KDFlow等系统探索了传输老师隐层状态而非完整logits的方向,能否将类似思路延伸到异步场景,是未来重要的研究方向。

对于关注AI大模型训练效率的从业者而言,这项研究提供了一套可以直接参考的设计指南——不仅仅是"异步训练可以用"这样模糊的结论,而是精确到"哪种KL、哪种优势值、哪种采样策略、哪种调度器"的细粒度答案。代码已通过GitHub开源,地址可通过论文编号arXiv:2606.24143获取。

---

Q&A

Q1:异步在线策略蒸馏(AsyncOPD)相比传统同步蒸馏训练,实际能提升多少训练速度?

A:根据论文实验结果,AsyncOPD相比严格同步训练可以实现1.6倍到3.8倍的吞吐量提升,具体倍数取决于模型大小和蒙特卡洛缓存设置。较小的模型和较少缓存样本(MC1)时提升幅度更大,最高接近3.3至3.8倍;较大的模型(如8B)提升幅度相对更温和,约为1.6至1.9倍。在所有测试场景中,最终模型准确率都与严格同步方案保持相当。

Q2:前向KL和反向KL在异步蒸馏训练中有什么实际区别,选哪个更好?

A:两者最关键的区别在于对"过期数据"的容忍度不同。前向KL以老师的概率分布为中心,对学生参数变化不敏感,数据过期也能保持较好效果。反向KL以学生当前的概率分布为中心,数据过期后老师缓存的评分可能覆盖不到当前学生真正需要的词汇,导致性能快速下滑。若追求异步系统设计简便,前向KL更安全;若坚持使用反向KL,则需要配套使用当前参数重算优势值加蒙特卡洛采样等修正手段。

Q3:多样本蒙特卡洛(Multi-sample MC)中增加采样数量m,边际收益会一直增加吗?

A:不会一直线性增加。实验显示,从MC1升级到MC4时有最明显的性能提升,MC16和MC64相比MC4的额外收益逐渐减小,三者表现已经比较接近。从方差缩减角度来看,局部(单解码位置)方差随m增加近似成1/m比例下降,但序列整体方差的缩减比例会相对温和,因为不同位置的梯度聚合本身就有一定的平滑效果。综合考虑计算开销与性能收益,m选4或16是比较实用的平衡点。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-