微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 上交大等机构联合研发:让AI大模型推理速度提升5倍的"预测员"训练新法

上交大等机构联合研发:让AI大模型推理速度提升5倍的"预测员"训练新法

2026-06-05 12:16
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-05 12:16 科技行者

这项由上海交通大学、上海人工智能实验室、清华大学、香港中文大学、北京大学和浙江大学联合开展的研究,以预印本形式于2026年5月29日发布在arXiv平台,论文编号为arXiv:2605.29343。有兴趣深入了解的读者可通过该编号查阅完整论文。

当你打开手机,向某款AI助手提问一道复杂的数学题,它可能需要"思考"几十秒甚至更长时间才能给出回答。这背后的根本原因在于,大型语言模型(也就是驱动这些AI助手的核心程序)在生成文字时,必须一个字一个字地往外"吐",就像一个只能用单指打字的人,再聪明也快不起来。这种天然的速度瓶颈,让强大的AI在实际使用中显得有些"迟钝"。

一种名为"推测性解码"(Speculative Decoding)的技术,正是为了打破这种瓶颈而生的。它的核心思路可以用一个贴切的场景来理解:在一家重要文件审核机构,有一位经验老到的主审官(对应AI中的"目标模型"),他审阅文件极为精准,但速度较慢。于是,机构为他配备了一位动作敏捷的助理(对应"草稿模型"),助理负责提前草拟出接下来几段文字的内容,然后一并交给主审官过目。主审官只需快速扫描助理的草稿,如果写得准确就直接采纳,如果哪里出了错,就从错误处接手继续。这样一来,原本逐字审阅的流程就变成了批量审核,整体效率大幅提升。

这篇论文的研究团队发现,现有的助理训练方式存在一个根本性的缺陷,并由此提出了一套全新的训练方法——Draft-OPD(在线策略蒸馏),让助理的"预测准确率"实现了质的飞跃,最终将AI推理速度提升至原先的5倍以上。

一、为什么助理总是在"临场发挥"时出错

现有的助理训练方式,叫做"监督微调"(SFT,Supervised Fine-Tuning)。用刚才的比喻来说,这种方法是让助理大量阅读主审官以前亲手写好的范文,反复揣摩主审官的行文习惯和思维方式,直到自己也能模仿得像模像样。

这个方法在初期效果相当不错。研究团队绘制的训练曲线图显示,随着学习量的增加,助理的"一次性通过率"(即草稿被主审官连续接受的平均字数,专业上称为"接受长度"τ)稳步上升。然而,令人沮丧的是,这条曲线在某个点之后便陷入了停滞,像触碰到了一道无形的天花板——无论再给助理看多少范文,他的表现都不再进步,甚至有时还会略有下滑。

研究团队深入分析后,找到了症结所在:训练场景和实战场景之间存在根本性的错位。

训练时,助理读的全是主审官亲自起草的范文,每一段话的上下文都是主审官自己的风格。然而,实战时的情况完全不同——助理首先草拟出自己的内容,主审官审阅并纠正了某个词,接下来的上下文就已经掺入了助理自己的表达痕迹。问题在于,助理从未在"自己写错一个字之后"的场景下练习过。他学的是主审官在完美状态下的接续方式,而非他自己犯错后该如何挽回局面。

这种"训练时看的是别人的草稿,上阵时写的是自己的草稿"的错位,就是所谓的"离线到推理失配"。它解释了为什么一味地给助理看更多范文毫无意义——你无法通过让他读主审官的文章,来教会他如何应对自己的错误。

二、直接让助理"自己练习"为何又行不通

既然问题出在助理从未在自己的错误上下文中训练过,一个自然的想法是:为什么不直接让助理自己起草、自己学习呢?这就是"在线策略蒸馏"(OPD,On-Policy Distillation)的核心思路——让学生在自己生成的文本上学习,而不是老师准备好的范文。

然而,这个直觉上合理的方案,遇到了两个截然不同却同样致命的问题。

第一个问题:助理根本无法独立完成一篇像样的文章。现有的草稿助理(如EAGLE或DFlash风格的模型)在设计上是为了在主审官的协助下,预测接下来短短几个词,而不是作为一个完全独立的写作者。一旦脱离主审官的帮助,让它单独写下去,很快就会出现重复啰嗦、语义混乱的情况,就像一个只会背诵片段的人被要求即兴演讲,很快就会陷入"the the the the the"这样的困境。用这种乱糟糟的文本来训练,只会学到一身坏习惯。

第二个问题:引入主审官帮忙生成文本,反而又回到了老路。如果让助理先草拟,主审官来纠错,然后用纠错后的干净文本来训练,结果是什么?纠错后的文本又变成了主审官风格的范文!因为主审官会把助理写错的地方全部替换掉,最终的训练素材里根本看不到助理的原始错误。那些被删掉的"错误词",恰恰是最宝贵的训练信号——它们揭示了助理在实战中最容易犯的毛病,而这些信息就这样消失在了纠错过程中。

简而言之,直接让助理自己练习,文章写得一团糟;让主审官帮忙生成,又把错误都藏起来了。这两条路似乎都走不通。

三、Draft-OPD:一种巧妙的"错误还原"训练法

研究团队的解决方案,核心思路出人意料地简洁:既然纠错后的文本会把错误淹没,那就在纠错前先把错误"拍照存档",然后专门针对这些"出错现场"进行训练。

整个Draft-OPD方法分为两个主要步骤,可以用"拍照取证"加"现场复盘"来理解。

第一步,"拍照取证"——进行带有记录的正常推理。训练开始时,助理和主审官按照正常的工作流程运转:助理每次提出一个包含若干词的"草稿块",主审官检查后接受其中正确的部分,并把错误处纠正。关键在于,系统在每次助理开始起草之前,都会记下当时的起点位置,称之为"锚点"。这些锚点就是"出错现场的坐标"。最终生成的是一份主审官质量的完整文本,以及一系列标记着"助理曾经在这里起草过"的锚点位置。

第二步,"现场复盘"——在每个锚点处重新演算。有了这些锚点坐标,系统就能"时间倒流",回到每个起草起点,让助理重新提出当时那份草稿,并同时请主审官对同样的草稿进行评分。注意,这次不是让主审官纠错替换,而是让主审官对助理的原始草稿打分——哪个词自己会怎么选?这样就得到了两份数据:助理认为每个词多大概率正确,以及主审官认为那个词多大概率正确。更重要的是,那些在实战中被主审官否决的错误词,这次也被完整保留下来计算分数了。

通过这种"先记录锚点,再回放复盘"的双步骤设计,研究团队成功地保留了两个关键要素:一方面,正式推理过程由主审官保驾护航,不会产生一团糟的低质文本;另一方面,助理的原始错误草稿被完整地用于训练,没有被淹没。这就像在一场医学手术中,既保证了患者安全(由经验丰富的主刀医生主导),又完整记录了实习医生的每一个操作失误用于教学(错误现场被录像存档,而不是直接被覆盖)。

四、"被接受的词"和"被拒绝的词",该用不同的方式学习

有了这些被接受和被拒绝的词的原始数据,接下来的问题是:该怎么用它们来训练助理?

研究团队认为,被接受的词和被拒绝的词,分别代表不同性质的信息,应该用不同的学习策略来处理,这就是论文中所说的"接受感知蒸馏目标"。

被接受的词,意味着助理和主审官在这个位置上的判断是一致的,这是助理表现得好的地方。针对这些词,训练目标是让助理的理解更全面、更丰富地覆盖主审官所有可能的选择,专业上称为"前向KL散度"。可以把这理解为:既然助理在这个路口选对了方向,就应该把这个路口主审官认可的所有可能的好走法都熟悉一遍,避免死记硬背一条路。

被拒绝的词,意味着助理在这个位置上犯了错,提出了主审官不认可的词。针对这些词,训练目标是让助理重点压制自己最容易犯的那种错误,即让助理的高概率选择去靠近主审官的分布,专业上称为"反向KL散度"。可以把这理解为:助理在某个路口总是习惯性地走错,就要重点改掉这个坏习惯,让自己的第一直觉往正确方向靠拢。

此外,在同一个草稿块中,越靠前的被拒绝位置越重要,越靠后的位置由于前面已经出错,本就可信度不高,对训练贡献应当递减。研究团队用一个指数衰减的权重来体现这一点:设定一个衰减系数γ=0.8,草稿块中第k个位置的权重是0.8的k-1次方,第一个拒绝位置权重最高,后续依次降低。这好比在案件审查中,第一个漏洞最关键,后续的问题可能都是第一个漏洞引发的连锁错误,不能等量齐观。

最终的训练目标,是上述两部分损失的平均值,两者权重相等。这个设计使得助理能够从两类截然不同的信号中同时学习:在已经做对的地方做得更好,在做错的地方有针对性地纠偏。

五、实验结果:速度提升有多显著

研究团队在阿里云推出的Qwen3系列模型上进行了全面验证,涵盖了Qwen3-4B、Qwen3-8B和Qwen3-30B-A3B-Thinking三个规模的模型,并在数学推理(包括GSM8K、MATH-500和AIME竞赛题)、代码生成(MBPP、HumanEval和SWE-bench Lite)以及通用对话(MT-Bench)等七个不同类型的测试集上进行评估,同时考察了"思考模式"开启和关闭两种状态,以及贪心解码(温度为0)和随机采样(温度为0.6)两种生成方式。

在思考模式开启、贪心解码的条件下,Draft-OPD将平均接受长度从DFlash的5.35提升到了5.85,实现了平均4.88倍的实际加速比,相比EAGLE-3提升了23%,相比DFlash提升了13%。在温度为0.6的随机采样设置下,Draft-OPD依然是最快的方法,平均实现4.17倍加速。

思考模式关闭时,优势更加突出。Draft-OPD保持了6.33的平均接受长度,实现5.17倍平均加速。结合思考模式的结果来看,这说明Draft-OPD在长达数千词的推理轨迹和较短的普通回答上,都能有效提升草稿与目标模型的对齐程度。

更具有实际部署意义的是,研究团队还在SGLang这一工业级推理引擎上进行了吞吐量测试(使用FA3后端),模拟了并发用户数从1到32的真实服务场景。结果显示,Draft-OPD在所有测试的模型、任务和并发级别上,都稳定地提升了服务效率,平均提升接受长度11.2%。特别值得关注的是,在并发32的高压场景下,提升幅度甚至略高于单用户场景,说明收益不随负载增加而衰减,具有稳健的实用价值。以Qwen3-30B-A3B-Thinking为例,在AIME数学竞赛题测试中,Draft-OPD在并发32时的吞吐量达到4718 tok/s,而DFlash为4014 tok/s,提升幅度达17%。

六、细节验证:每个设计选择是否真的有效

为了证明每个设计决策都物有所值,研究团队进行了一系列"拆零件"实验,将Draft-OPD的各个组成部分逐一去除,观察性能变化。

关于训练数据来源,一个合理的质疑是:Draft-OPD的提升,是不是只因为它见了更多不同的题目,而不是因为在线训练方式本身?为了排除这一可能,研究团队将EAGLE-3和DFlash在同样的OPD题目池上进行额外的离线监督训练,然后与Draft-OPD对比。结果显示,Draft-OPD依然明显更好。这说明提升确实来自于在线蒸馏机制本身,而非数据多样性。

关于KL散度的方向选择,研究团队将接受感知的混合KL目标,分别替换为全部使用前向KL或全部使用反向KL的版本。全前向KL始终低于Draft-OPD,全反向KL则是三种KL变体中表现最差的。这验证了对接受和拒绝位置使用不同KL方向的设计是有意义的,而不是随意为之。

关于锚点位置的选择,研究团队将"在推理出错的位置复盘"替换为"随机选择位置复盘"。随机锚点版本的接受长度和加速比都明显下降。这说明不是所有在线状态都同样有价值,专门针对出错位置训练,才能把有限的计算资源花在刀刃上。

关于位置衰减权重,去掉衰减权重(即对同一草稿块内所有被拒绝位置等权重对待)后,性能有所下滑。这印证了一个直觉:草稿块中越靠前的错误越根本,后续位置的错误很可能只是前面错误的连锁反应,应当区别对待。

此外,研究团队专门分析了"天真的主审官辅助推理"基线,即让主审官帮助生成文本,但直接用纠错后的最终文本来训练,不做任何错误现场的还原。这个版本的平均加速比从Draft-OPD的4.63倍下降到4.29倍,相对降幅达7.3%。这清晰地表明,保留草稿模型在验证时的原始错误是有效在线训练的必要条件,仅仅使用主审官辅助的稳定推理是不够的。

七、思考模式下为何仍有差距

论文中还有一个值得关注的观察:不管是Draft-OPD还是其他方法,在思考模式开启时的绝对加速比,都明显低于思考模式关闭时。研究团队对此给出了一个有意思的解释。

他们让Qwen3-4B模型分别在思考和非思考两种模式下,对同样的提示词生成回答,然后在每个词的位置计算"下一个词的负对数概率"(可以理解为:模型对自己即将选择的词有多不确定)。结果发现,思考模式下的曲线始终高于非思考模式——也就是说,思考模式下的模型本身对下一个词更不确定。

这背后的原因在于,思考模式要求模型进行长链条的推理,推理过程中每一步都可能有多条合理路径,模型自身的"心思"就是分散的。助理要在这种高度不确定性中精准预测主审官接下来会说哪个词,难度自然更高。Draft-OPD通过针对出错位置的在线训练,部分缓解了这一挑战,但研究团队也坦承,专门为推理型解码优化的草稿模型训练方案,仍是一个值得深入探索的方向。

归根结底,这项研究解决的是一个"训练和考试不一样"的老问题——AI助理在训练时只见过老师写的文章,却要在考试时凭借自己的思路答题,自然会有落差。Draft-OPD的聪明之处在于,它没有简单地堆砌更多训练数据,而是在推理过程中悄悄记录下助理出错的那一刻,然后针对这些"出错现场"专门补课。这种精准打击式的训练方式,让助理在实战中的表现大幅接近主审官,从而让AI整体的推理速度提升到了一个新台阶。

对于日常使用AI工具的普通用户而言,这项研究意味着:未来你向AI提问复杂问题时,等待的时间可能会显著缩短;对于需要大规模部署AI服务的企业而言,在同等算力投入下,能服务的用户数量将大幅增加,服务成本随之降低。

当然,这套方法目前只在Qwen3系列模型和DFlash架构上进行了验证,能否无缝迁移到其他模型家族和架构,还需要更多探索。此外,训练时生成长度被限制在4096个词,而测试时有时会用到8192个词,如何在更长的推理链条上同样有效训练,也是一个尚待解决的实际问题。由此引申出一个思考:如果能在更长的文本上进行在线训练,草稿模型的能力天花板究竟会在哪里?这个问题或许值得感兴趣的读者继续追踪这一研究方向的后续进展。有兴趣深入了解完整技术细节的读者,可通过arXiv编号2605.29343查阅原论文。

Q&A

Q1:推测性解码(Speculative Decoding)技术是如何提升AI推理速度的?

A:推测性解码用一个轻量级的"草稿模型"预先提出几个词,再由主模型批量验证,接受正确的部分,错误处才重新生成。这样主模型不必一个词一个词地处理,而是一批批地审阅,大幅减少了昂贵的主模型计算次数,从而提升整体速度。

Q2:Draft-OPD和普通监督微调(SFT)相比,关键差异在哪里?

A:普通SFT让草稿模型学习目标模型写好的文本,训练和实战场景不一致。Draft-OPD则在实际推理过程中记录草稿模型出错的位置,然后专门在这些"出错现场"进行训练,让模型直接学习如何应对自己在实战中产生的错误,从而打破了SFT的性能瓶颈。

Q3:Draft-OPD对普通用户使用AI产品有什么实际影响?

A:Draft-OPD让AI在回答复杂问题时的速度提升超过5倍,意味着用户等待AI回复的时间会明显缩短。对于企业来说,同样的服务器算力可以支撑更多并发用户,AI服务的使用成本也会随之降低。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-