
这项由阿里巴巴通义实验室与北京大学联合开展的研究,于2026年5月28日以预印本形式发布,论文编号为arXiv:2605.29860,有兴趣深入了解的读者可通过该编号查询完整论文。研究提出了一种名为ESPO(Early-Stopping Proximal Policy Optimization,早停近端策略优化)的训练方法,专门针对大型语言模型在强化学习训练过程中存在的一个长期被忽视的浪费问题。
**一、问题的起点:AI走了弯路,却还被迫继续走下去**
考虑这样一个场景:你正在学习解数学题,当你在第二步就算错了一个数字,之后的所有推导都注定错误。一个明智的老师会在你写错的那一刻叫停你,指出错误,而不是等你把整道题从头到尾写完再说"这道题做错了"。然而,现有的人工智能训练方式恰恰是后者——不管模型在哪一步出了问题,系统都会强制它把整个解题过程写到底,最后才告诉它"这次答错了"。
这就是研究团队所说的"轨迹延续问题"。在用强化学习训练大型语言模型时,模型需要生成一段一段的推理过程,每段过程可能有几百甚至几千个字。当模型在某个早期步骤犯了一个无法挽回的错误——比如错误地识别了一个数学运算符号,或者在逻辑证明中走进了死胡同——后续的所有输出都是在错误的基础上堆砌的垃圾内容。这些垃圾内容既得不到任何正向反馈,又会混入训练信号,把模型的学习方向带偏。更糟糕的是,这些本可省下的计算资源就这样白白浪费掉了。
过去的研究并非没有意识到这类问题。一些方案要求人工标注推理过程的每一步是否正确(称为"过程奖励模型"),这样的标注工作量极为繁重。另一些方案通过改进奖励计算方式(如GRPO和DAPO)来减少信号噪音,但它们依然会让模型把每条轨迹走到底,并没有从根本上解决浪费的问题。还有一类方案(如强化学习中的Option-Critic框架)专门学习"何时停止",但这需要额外训练一个独立的终止模块,增加了模型的复杂度。
研究团队的解法是:既不需要人工标注,也不需要额外模型,完全利用训练过程中已经产生的信号,实时判断"这条路是不是已经走偏了,再走下去也没用"。
**二、核心思路:用"信心差距"来判断模型是否已经偏离正轨**
ESPO方法的核心直觉非常朴素。当一个人在解题时突然开始犹豫、选择了一个自己并不那么确信的步骤,而且这种犹豫不断积累,同时对后续能否解出题目也越来越悲观,这通常是一个危险信号。ESPO把这个直觉数学化,变成了一套可以自动运行的判断机制。
具体来说,模型每生成一个词(token),系统会悄悄观察一件事:模型原本最想生成哪个词,和它实际生成了哪个词,这两者之间的"信心差距"有多大。在正常情况下,模型生成的词往往就是它最偏好的那个,差距很小。但当模型开始生成不那么有把握的内容时,这个差距会扩大。研究团队把这个差距称为"逐步偏差信号",并用公式表示为:当前步骤的最高词汇得分减去实际生成词汇的得分,差值越大,说明模型越是在"硬着头皮"生成它并不确信的内容。
然而,光看单一步骤的差距容易产生误判——偶尔生成一个不那么常见的词并不代表推理走偏了。因此,系统会把这些信号平滑地累积起来,就像用一只手慢慢托起一摞硬币,不是某一枚硬币特别重就报警,而是当整摞硬币的重量明显超出预期时才采取行动。这种累积方式使用了指数移动平均(一种对历史数据赋予衰减权重的平滑技术),让近期的信号权重更高,而不是简单地把所有步骤的差距相加。
但仅凭偏差信号还不够,因为有时候模型会选择一个"冷门但正确"的词,这种情况下偏差信号也会偏大,但推理未必走偏。为了解决这个问题,ESPO引入了第二个信号:模型的价值估计,也就是当前状态下批评网络对"还能答对这道题的概率"的预测。如果价值估计高,说明模型认为自己还有机会答对,就算偏差信号大一些也可以再等等;如果价值估计很低,说明模型自己都觉得没戏了,这时候较小的偏差累积就足以触发停止。
这两个信号的组合构成了ESPO的"价值门控早停准则":当平滑后的累积偏差显著超过当前价值估计乘以一个系数时,系统就终止这条轨迹的生成。整个判断过程完全依赖模型在正常生成过程中已经计算好的数据,不需要额外的前向传播,计算开销几乎可以忽略不计。
**三、停下来之后:如何让这次"及时刹车"变成有效的学习经验**
仅仅停止生成还不够,关键在于如何处理这条被提前截断的轨迹,让它真正成为有用的训练信号。
当ESPO在某个时间步决定停止时,系统会把这个终止点标记为一个"吸收性失败状态"——可以理解为一个死胡同,没有出路,也没有后续。系统给这个终止点赋予一个负面的终端奖励(在实验中设置为-1.0),而之前所有步骤的即时奖励都是零。
这样设计的好处体现在模型的学习机制上。强化学习中有一种叫做"时序差分误差"的概念,可以理解为"预期收益与实际收益之间的落差"。当终止点出现一个集中的负面奖励时,这个落差会在终止点最为突出,并通过一种叫做"广义优势估计"的反向传播机制,逐步向更早的步骤传递影响。这意味着不仅终止步骤会得到负向反馈,在此之前导致错误的那些步骤也会陆续"感受到"惩罚,从而让模型学会在更早的阶段就避免走入错误方向。
研究团队特别强调,这种设计刻意选择了"在终止点集中惩罚"而非"每一步都给小惩罚"。如果每一步都施加状态依赖的惩罚,会引入一个持续变化的奖励函数,这会让批评网络难以学习,还可能让模型为了减少惩罚而选择把所有词汇的生成概率都压平——结果是模型变得过于保守、不敢探索,反而影响学习质量。集中惩罚的方式则干净利落,不带来这类副作用。
**四、防止"误杀":暖机保护和自适应阈值控制**
任何自动判断系统都面临误判的风险。如果停止条件设置得太敏感,可能会把一些"暂时犹豫但最终正确"的推理也给截断,这对模型的学习是有害的。
研究团队为此设计了两道保险机制。第一道是"批评网络暖机阶段"。训练刚开始时,批评网络(负责预测价值的那部分模型)是随机初始化的,它对当前状态的价值估计几乎没有意义。如果这时候就用价值估计来决定是否停止,肯定会产生大量错误的截断。因此,ESPO在训练初期会完全禁用早停功能,让批评网络先在正常的PPO训练下稳定下来。判断批评网络是否"成熟"的标准是:当批评损失的绝对值低于0.5,或者相邻步骤的损失改善幅度低于0.1并连续保持三步时,认为批评网络已经收敛。如果在训练总步数的10%以内批评网络仍未收敛,则无条件结束暖机阶段,避免早停功能被无限期推迟。
第二道保险是"比例控制器",用来稳定整体的停止频率。系统设定了一个目标停止率(实验中为25%),并通过一个自动调节的乘数β来维持这个比率。如果实际停止率偏高,β就增大,让停止门槛提高,减少截断;如果停止率偏低,β就减小,让门槛降低,增加截断。暖机结束后,β还会经历一段从较高初始值线性下降到目标范围的过渡期,避免早停功能突然激活给训练带来剧烈冲击。
**五、实验结果:数字背后的故事**
研究团队在两个规模的模型上验证了ESPO的效果,分别是参数量为15亿(1.5B)和70亿(7B)的DeepSeek-R1-Distill-Qwen系列模型,使用DAPO-Math-17k数据集训练,并在三个数学推理基准测试上评估:AIME 2024(面向高中生的美国数学邀请赛题目)、AMC 2023(美国数学竞赛题目)以及MATH-500(一个包含500道数学题的标准测试集)。
在7B规模的模型上,ESPO在AMC 2023上达到85.83%的准确率,在AIME 2024上达到46.28%,在MATH-500上达到87.42%,三项全部超过了标准PPO方法(分别为82.94%、45.25%、85.43%)和DAPO方法(分别为83.76%、45.57%、85.95%)。与此同时,ESPO在500个训练步骤内累计消耗的生成词汇数量约为8.39亿,比PPO少了约22%,比DAPO少了约19%。三项基准的平均准确率,ESPO以73.17%领先PPO的71.20%(高出约2个百分点)和DAPO的71.76%(高出约1.4个百分点)。
在1.5B规模的模型上,情况同样乐观。ESPO在AMC 2023上达到71.87%,在MATH-500上达到81.53%,平均准确率59.09%,超过PPO的57.03%和DAPO的58.29%。唯一的例外是在AIME 2024上,ESPO的23.87%略低于DAPO的24.37%,但ESPO消耗的累计词汇数量(9.28亿)远少于DAPO(12.24亿,少24%)和PPO(10.70亿,少13%)。换句话说,ESPO用更少的计算资源取得了整体更好的效果。
从训练曲线来看,ESPO在训练早期就开始拉开与PPO的差距,并在整个训练过程中持续保持领先。累计节省的词汇数量随着训练步数的增加而持续扩大,到训练结束时节省比例接近并超过20%。
**六、逐一拆解:每个零件到底有多重要**
为了验证ESPO各个组件是否真的不可或缺,研究团队设计了一系列对照实验,每次只拿掉或替换其中一个部分,观察效果的变化。所有对照实验都在7B模型上进行,以AIME 2024的准确率作为主要衡量指标。
去掉批评网络暖机阶段后,AIME 2024的准确率从46.3%下降到44.2%,损失了2.1个百分点。这说明暖机阶段确实在保护训练早期阶段的探索质量方面发挥了重要作用。
去掉终止点的集中失败惩罚后,准确率下降到43.7%,损失了2.6个百分点,同时平均轨迹长度也从3278个词增加到3522个词。这意味着没有集中惩罚时,系统既没能给模型提供精准的负面信号,也没能有效减少无用的计算浪费。
把双信号判断替换为只用价值估计的单信号停止(即只要价值低于阈值就停),准确率降至44.0%,且平均词汇数量上升到4258个——这说明纯价值判断的灵敏度不足,很多本应截断的轨迹没有被截断。反过来,只用偏差信号而不加价值门控,准确率为44.8%,词汇数量也高达4244个——这说明没有价值信号来区分"确实出错"和"只是选了个小众但正确的词",误判率会上升。两个信号的组合,确实比任何一个单独工作都更有效。
最关键的对照实验是"随机停止":以与ESPO相同的频率随机截断轨迹,但不考虑任何信号。结果是AIME 2024准确率仅有42.4%,不仅低于ESPO的46.3%,甚至低于什么都不截断的标准PPO(45.25%)。这个结果有力地说明,ESPO的收益不是来自"生成更短的序列"本身,而是来自"在正确的位置截断"——它必须是在真正出错的地方停下来,才能把有价值的训练信号和无价值的噪音分开。
**七、早停会不会让AI变得更胆小、更保守?**
对于这类主动干预训练过程的方法,一个自然的担忧是:既然ESPO会在模型生成"不太确定"的词时提高警惕,那么长此以往,模型会不会越来越只敢生成"最保险"的词,失去探索能力?
实验数据显示,情况恰恰相反。研究团队追踪了训练过程中模型输出的信息熵(可以理解为模型在每个位置生成词时的"犹豫程度",熵越高说明模型有更多元化的选择)。ESPO在整个训练过程中维持了比PPO更高的信息熵,也就是说,它不仅没有导致模型变得更保守,反而让模型保持了更好的多样性。
研究团队对此给出了解释:ESPO并没有直接惩罚任何特定的词汇选择,它的停止机制是基于累积信号的整体判断,而不是针对单个词施加负面反馈。更重要的是,在标准PPO训练中,那些"走偏后继续生成的错误词汇"会积累负面梯度,误导模型认为某些词汇本身有问题。ESPO截断了这些错误词汇,反而消除了这些错误归因的压力,让模型可以自由地保留对多种合理续写方向的概率质量。
**八、假阳性问题:ESPO有没有错误地截断正确的推理?**
研究团队还专门追踪了"误杀率"——即在那些如果继续生成原本可以得到正确答案的轨迹中,有多少被ESPO错误地提前截断了。
结果显示,在整个训练过程中,平均每批数据里有约2.7%的轨迹属于误杀——模型原本能答对,但被提前截断了。这个比率虽然不为零,但考虑到ESPO带来的整体准确率提升,研究团队认为这是可以接受的代价:去掉那些大量真正走偏的轨迹所带来的收益,远远盖过了偶尔错误截断几条"浪子回头"轨迹所带来的损失。
值得一提的是,随着训练推进,误杀率呈现出轻微的上升趋势,在训练后期接近5%至6%。这与批评网络越来越稳定的同时,停止条件也逐渐放松的机制有关。研究团队指出,这是ESPO在当前设计下的一个内在局限,未来可以通过更精细的阈值策略进一步改善。
**九、这个方法的边界在哪里,未来还能往哪里走**
研究团队也坦诚地讨论了ESPO目前的局限性。最明显的一个问题是:ESPO对"自信地犯错"的模型效果较差。如果模型非常确定地选择了一个错误的推理路径,逐步偏差信号会接近零(因为模型生成了它"最喜欢"的词),早停机制几乎无法察觉到问题,直到整条轨迹失败。这类错误更像是模型的系统性偏见,而非随机噪声,单纯依靠偏差信号难以捕捉。
另一个局限是目标停止率目前需要手动调节。研究团队在实验中设定为25%,但不同规模的模型、不同难度的任务,最优的停止率可能差异很大。未来的研究可以探索更自适应的机制,让停止率能够根据任务难度和模型状态动态调整,减少对人工设定的依赖。
此外,ESPO目前的设计完全基于单轮生成的词级别信号,在工具调用、多轮对话、智能体环境等场景中,错误可能跨越多个交互回合才会显现,现有的停止机制无法直接适用。将早停思想扩展到这些更复杂的场景,是研究团队明确提出的未来方向。
---
归根结底,ESPO做的事情可以用一句话来概括:让AI在训练时学会"及时止损",而不是像一个倔强的学生,明知道这道题做错了,还要把错误写到最后一行才肯停笔。
这件事看起来简单,但实际上需要很多精巧的设计:如何判断"已经错了"而不是"只是在犹豫",如何在停下来之后让这次失败变成一次有效的教训,如何避免让AI因为害怕被截断而变得不敢探索——每一个环节都需要细心权衡。研究团队用两种规模的模型、三个数学测试集、以及一系列拆解实验,验证了这套机制的有效性,也诚实地指出了它目前还做不到的事情。
对于关心AI如何更高效、更省电地训练的人来说,ESPO提供了一个新的思路:不是让模型跑得更快,而是让它少走弯路。在算力成本持续攀升的今天,这种"少做无用功"的训练哲学,或许会越来越受到重视。有兴趣深入了解技术细节的读者,可以通过arXiv编号2605.29860查阅完整论文。
---
Q&A
Q1:ESPO与普通PPO训练方式有什么本质区别?
A:普通PPO方法会让语言模型把每一条推理轨迹生成到固定的最大长度,即使中途已经出现了无法挽回的错误,也继续生成到底。ESPO的区别在于,它在每一步生成时都实时监测两个信号——模型对当前生成词的"信心差距"以及批评网络对后续答对概率的估计——当这两个信号共同表明轨迹已经走偏时,立即停止生成并施加集中的负面惩罚,而不是等到最后才提供反馈。
Q2:ESPO训练出来的模型在实际使用时会不会生成更短的答案?
A:实验数据显示,ESPO训练出的模型在测试时生成的答案长度与PPO训练的模型相近,因为ESPO只在训练阶段截断那些已经走偏的轨迹,并不会直接压缩模型对正常推理过程的生成偏好。训练中那些正常完成的轨迹长度与PPO保持一致,说明模型的基本生成习惯没有被破坏,准确率还有所提升。
Q3:ESPO会不会误判,把原本正确的推理过程也给截断?
A:会,但概率较低。实验记录显示,在整个训练过程中平均约有2.7%的轨迹属于误判截断,即那些如果继续生成原本可以得到正确答案的轨迹被提前终止了。研究团队认为这个代价在可接受范围内,因为被正确识别并截断的失败轨迹所带来的训练质量提升,远远超过了这小部分误判造成的损失。
好文章,需要你的鼓励
这篇论文提出一种插件式2D动作接口,让已训练好的3D运动语言模型无需修改或微调即可直接理解2D姿态输入。实验证明2D输入效果媲美3D输入,且在真实视频场景下配合专门的降噪适配器,2D方案比3D姿态估计更省算力、更实用,为动作理解模型的现实部署提供了新路径。
研究团队让8种AI智能体独立完成100项真实科研任务,深度剖析800份研究轨迹后发现,即便是最强模型,也普遍存在"发现问题却不修正"的现象,背后根源指向AI缺乏检验自身产出、主动纠错的元认知能力。
WorldRover是一套面向可探索世界建模的合成视频数据引擎,基于虚幻引擎构建,能让同一段探索轨迹在保持路线与场景一致的前提下,重新渲染为多种视角和外观状态,并同步提供深度、光流、长程点追踪等丰富标注,最终发布WorldRover-10M数据集,含2190万帧、202.7小时视频。
这篇论文指出,现有多目标强化学习训练大模型时存在"一刀切"分配优化精力的问题,提出SA-MRPO方法,根据每个奖励目标的饱和程度动态调整其权重,在数学推理、自适应推理、代码生成等任务上均取得优于现有方法GDPO的效果。