
这项由美国威斯康星大学麦迪逊分校与阿贡国家实验室联合完成的研究,于2026年6月24日以预印本形式发布,论文编号为arXiv:2606.26080,感兴趣的读者可通过该编号在arXiv平台查阅原文。
当一个AI助手学会帮你订机票、网购比价、管理日历,背后其实经历了一段漫长的"训练之旅"。训练完成后,人们自然想知道:这个AI在执行任务时,每一步做得好不好?它是不是在正确的道路上前进?还是已经悄悄走岔了路?
这个看似简单的问题,实则是AI领域公认的难题。要评估AI每一步行动的质量,研究者通常需要专门训练一个叫做"过程奖励模型"的工具,相当于给AI配备一个随行评委。然而这个评委的培养代价极高——需要大量人工标注数据,需要反复试错验证,而且还只擅长某一特定任务,换个场景就可能失灵。
威斯康星大学的研究团队偶然发现:其实根本不需要另外请评委。AI在完成强化学习训练后,训练过程本身已经悄悄留下了评分所需的全部信息。从训练前的"原始模型"到训练后的"成熟模型",两者之间的概率差异,恰好就是衡量每一步行动质量的黄金标准。他们将这个发现命名为"进展优势"(Progress Advantage),并在五个不同的测试场景和四个模型家族上验证了它的效果——结果不仅超过了所有无需训练的基线方法,还在多数情况下击败了专门训练过的评委模型,以及价格不菲的顶级商业AI评判者。
这项发现的意义在于:你已经为AI支付过一次训练费用,而这次训练,实际上还附赠了一把免费的评分钥匙。
一、给AI打分,为何如此困难
要理解这项研究解决的问题,先从一个更熟悉的场景入手。假设你在训练一名厨师学徒,最简单的评估方式是看最终做出来的菜好不好吃。但如果任务复杂,比如学徒要连续做十道工序,其中某一步刀工出了问题,最终成菜的失败未必立刻显现。等你尝到菜时,早已无法回溯是哪一步出了错。
AI助手面临的情况与此类似,甚至更为棘手。当AI助手帮你处理一项复杂任务时,它可能需要执行几十步甚至几百步操作:调用工具、获取数据、分析结果、向用户反馈……每一步都在特定的状态下发生,而且很多操作是不可逆的——就像发出去的邮件收不回来,删掉的文件找不到了。
在这种环境里,如果你只有任务完成后的"总评分",就很难知道问题出在哪里。更关键的是,给AI的每一步操作单独打分,本身就需要大量人工劳动,或者依赖一种叫做"蒙特卡洛估计"的统计技巧——让AI从同一状态出发反复尝试很多次,通过统计平均来估算每一步的价值。然而在现实的AI助手场景中,这种反复试验根本行不通,因为动作已经发生,状态已经改变,环境是不可重复的。
研究者们把这种专门评估每一步行动质量的工具,称为"过程奖励模型"。它的作用,就像一位随时跟在学徒身后、每个工序都给出实时评价的资深主厨。但问题是:培养这位"主厨评委"本身就是一项浩大的工程。而且即便培养成功,这位评委也往往只擅长某一类菜系,换了餐厅就可能水土不服。
这就构成了一个两难困境:最需要过程评估的AI助手场景,恰恰是最难建立评估体系的地方。研究团队决定换一种思路来打破这个僵局。
二、训练留下的"隐形指纹"
强化学习(Reinforcement Learning,简称RL)是现代AI助手训练的核心技术。如果你没接触过这个概念,可以把它理解成一种"奖惩学习法"——AI每次做出一个行动,会根据结果获得奖励或惩罚,通过无数次试错逐渐学会怎么做才能最大化奖励。
这种训练方式有一个具体的数学结构。在训练开始前,存在一个"参考策略",也就是AI的初始状态,可以理解为刚出校门还没经过实践磨练的新人。训练之后,AI变成了"行为策略",也就是经过实战历练的熟手。训练的目标,是让熟手在获得更高奖励的同时,不要跑得离新人太远——这个"不要跑太远"的约束,在技术上叫做KL散度惩罚,可以理解为一种"不忘本"的约束机制。
研究团队注意到了一件有趣的事:在这个训练框架下,新人和熟手对于同一个动作给出的概率之差,其实隐含了大量信息。当熟手认为某个动作很重要、很有价值时,他会给这个动作更高的概率;新人由于经验不足,则会对各种动作的概率分配更为平均。因此,熟手概率除以新人概率(或者取对数后相减),就能反映出"这个动作在熟手眼中比初学者眼中高出多少"——这个差值,正是对该动作价值的一种度量。
然而,这个直觉虽然吸引人,却还不够精确。早期有研究者在更简单的场景(比如AI做数学题)中使用过类似思路,发现确实可行。但AI助手的情况更复杂:当AI在与外部环境互动时,环境会给出随机的反馈——比如网站返回的数据、工具调用的结果、用户的实时回复——这些随机因素会让原本简洁的数学关系变得复杂,之前的理论推导不再成立。
研究团队在论文中明确指出了这个区别,他们把这种情况定义为"随机MDP"(随机马尔可夫决策过程),区别于之前研究中默认的"确定性MDP"。在随机环境下,原来的推导会出现额外的残差项,让概率比值无法再直接对应奖励值。面对这个障碍,团队的应对思路十分精妙:既然精确奖励无法直接从概率中还原,那就换个目标——不追求绝对奖励,而是追求"相对于平均水平的优势"。
三、"优势"比"奖励"更聪明
在强化学习的理论体系中,"优势函数"是一个基础概念,理解它需要先区分两个容易混淆的量。
"奖励"告诉你这个动作之后得到了多少分,但这个分数里包含了两层信息:第一,当前处于什么状态(有些状态天然难、有些状态天然容易);第二,在这个状态下你的选择有多好。就像学生考试,一道简单题得了满分和一道难题得了高分,前者未必代表学生更厉害,因为那道题本身就很容易。
"优势"则剥离了第一层信息,专门衡量"你在这个状态下的选择,比平均水平好多少"。换句话说,优势函数回答的是:控制了题目难度之后,你的发挥如何?
这个区别在AI助手的场景中尤为重要。当AI帮你处理一项任务,某一步骤恰好遇到了很容易处理的情况,哪怕做得一般,奖励也可能很高;而另一步骤遇到了非常棘手的边界情况,即便处理得相当出色,奖励也可能平平。如果只看奖励,你会误以为前者比后者做得更好。优势函数则能纠正这种误判。
研究团队在论文的核心定理中证明了一个令人惊喜的结论(命题1):在随机环境下,训练后的"熟手"模型概率与"新人"参考模型概率之比取对数,乘以训练系数β,恰好等于最优优势函数。这个结论完整地成立,不需要任何关于环境如何随机的知识,也不需要明确知道奖励函数的形式。
直觉上这为何成立?关键在于:优势函数本身的定义就已经抵消掉了状态价值项。随机性被包含在了Q值和V值的计算中,而这两者相减(即优势)恰好把随机性的影响自然消除了。换一种说法:熟手和新人的概率之比,不受"当前状态有多难"的影响,只反映"在这个状态下这个动作有多好"。
此外,研究团队还专门验证了这个结论对更广泛的训练算法适用(命题2)。目前主流的强化学习算法有两类:一类显式地包含KL散度惩罚项(如PPO、GRPO等);另一类不直接惩罚KL散度,而是用"裁剪代理目标"来隐式约束策略变化(如DAPO、Dr.GRPO等)。团队证明,使用裁剪机制的算法,从数学上等价于在某个KL半径约束下进行优化,因此进展优势的结论同样适用。这意味着,几乎所有现代主流强化学习训练的AI,都自动携带了这把评分钥匙。
四、从理论到工具:如何实际使用
理论推导固然优雅,但要在实际中使用进展优势,还需要几个工程层面的决策。
第一个决策是选择哪对模型作为"熟手"和"新人"。对于熟手(行为策略),使用任何经过强化学习后训练的模型即可。对于新人(参考策略),则需要选用该模型训练时对应的参考检查点。例如,如果使用Qwen3.5-9B这个训练后的模型,就应该配合它的基础预训练版本Qwen3.5-9B-Base作为参考。研究团队指出,这里有一个重要的平衡:参考策略与行为策略不能太近,太近则信号太弱,区分不了好坏动作;但也不能太远,太远则差异主要来自通用分布差异而非任务相关信息。恰好的"距离",是这个方法有效性的关键。在实际操作中,研究团队仅使用了公开发布了完整检查点对的模型家族,并在文中附录列出了具体的模型对应关系,包括Qwen3.5、Qwen3、Qwen2.5、Gemma4和Olmo3这五个系列。
第二个决策是如何把每个词元(token,可以理解为AI输出的最小单位,类似于一个字或词)的优势分数聚合成步骤级别和轨迹级别的评分。毕竟,一个AI步骤可能包含几十到几百个词元,而一次完整的任务轨迹又包含多个步骤。研究团队系统测试了多种聚合策略:对词元取求和、取平均、取最大值或取最小值,然后在步骤之间再做一轮求和、平均、最后一步或最小值聚合,形成五乘五共二十五种组合。
实验发现,不同任务对聚合方式的偏好差异显著。对于最优选择任务(从多个候选中选最好的),词元层面取平均、步骤层面取最小值的组合效果最好——这相当于"找出最薄弱环节"的策略,任何步骤出现明显失误都会被惩罚。对于成功预测任务(判断这次任务会不会成功),词元取最大值、步骤取平均的组合表现更优——这相当于关注"局部的闪光时刻",那些关键的高优势词元往往是任务成败的指示灯。研究团队还发现,这种差异有其内在逻辑:在航空领域的客服任务中,成功与失败的差异往往分布在整个对话过程中,是缓慢积累的;而在零售领域,一次关键的工具调用就可能决定任务命运,因此聚焦最后步骤或最大值更有效。
第三个决策是如何处理词元概率本身可能存在的噪声。直接使用单个词元的概率有时不够稳定,为此研究团队还提出了一种平滑变体:对每个位置取概率最高的前k个词元取平均对数概率,再做差,称为"进展k-优势"。对比实验表明,在某些需要精确步骤级信用分配的场景下,平滑版本略优于原版;但在多数情况下,原版已经足够稳健,且更直接地对应理论推导。
五、三场真实考验的成绩单
研究团队为进展优势设计了三类不同的应用场景,每种场景测试不同维度的能力。
第一类应用叫做"测试时扩展",本质上是为同一个任务生成多条候选路径,然后用进展优势作为评分器选出最好的那条。这里用到的是最优选择的逻辑:生成8条候选轨迹,分别打分,选择得分最高的提交。研究团队在四个测试集上验证了这一做法,包括多轮工具调用能力测试(BFCLv4-MT)、模拟网购任务(WebShop)、综合性工具调用任务(AgentDojo)以及模拟航空客服对话(τ?-bench Airline)。
在平均成功率方面,进展优势让Gemma4-4B系列模型的成功率比所有基线方法高出约15.5个百分点,Qwen3.5-9B系列则高出约11.3个百分点。更有意思的是,进展优势的优势在"探索性解码"有价值的任务上尤为突出。具体来说,当用较高随机性(温度参数0.7)生成的多条候选轨迹中存在明显质量差异时,进展优势能够更准确地识别出那条真正优秀的路径,而其他方法则更容易被表面上流畅或自信的轨迹欺骗。研究者还在附录中追加了与AgentPRM(一个专门为WebShop任务训练过的任务特定奖励模型)的对比,发现进展优势在没有任何任务特定训练的情况下,仍然胜过了这个专门调教过的评判工具。
第二类应用是"不确定性量化",即预测一条已经生成的轨迹最终会不会成功。这个能力对于部署中的AI系统非常实用——如果能在任务结束前就察觉到"这次可能要失败",就可以提前干预或寻求人工支持。研究团队用ROC曲线下面积(AUROC)来衡量这种二分类预测的质量,1.0表示完美预测,0.5相当于随机猜测。
在四个模型家族和两个任务域(航空和零售)的组合测试中,进展优势在航空领域的平均AUROC达到0.781,远超所有基线方法,包括专门训练的WildReward-8B(平均0.420)、ThinkPRM系列(最高0.520),以及另外两种无需训练的置信度方法(最高0.669)。更令人意外的是,进展优势还超过了Anthropic公司的Claude Sonnet 4.6作为"法官"的评分表现(0.644)。在零售领域,进展优势的表现同样具有竞争力,均值0.671,整体排名靠前。研究团队还测试了一种跨模型使用的场景:用Gemma4-4B的进展优势来评判Qwen3.5-9B或Qwen3-14B生成的轨迹,结果依然显著优于置信度基线,表明进展优势具备一定的跨模型迁移能力,未来有可能作为通用的"外部审计工具"使用。
第三类应用是"失败归因",目标是在一条已经判定失败的多智能体轨迹中,精确找出"最关键的失误发生在哪一步"。研究团队使用了Who & When基准数据集,该数据集包含184条由多个AI协作完成但最终失败的任务轨迹,每条轨迹都有人工标注的关键失误步骤。进展优势的使用方式是:把每一步的进展优势当作该步骤的质量信号,找到信号最低的步骤作为预测失误点。
在包含人工精心设计的测试案例的子集中,进展优势的步骤级预测准确率接近于专门用强化学习训练来完成这项任务的工具AgenTracer(一个用2500条带标注轨迹训练的专用模型),而在算法生成测试案例的子集中,进展优势也展现出相当的竞争力。这一结果说明,进展优势作为步骤级信用分配工具,在不需要任何任务特定训练的前提下,已经接近了专门调教的专业级工具的能力水平。
六、为什么两个模型对比比单个模型更有信息量
一个自然的疑问是:进展优势用了两个模型(熟手和新人),是否只用其中一个就够了?毕竟,很多现有的置信度方法就是只看当前模型对词元的输出概率。
研究团队设计了专门的消融实验来回答这个问题。他们在八种不确定性量化场景(两个任务域乘以四个模型家族)下,分别对比了三种信号的最优表现排名:进展优势(熟手除以新人)、纯熟手概率(只看行为策略),以及纯新人概率(只看参考策略)。结果显示,进展优势的平均排名为1.44,而纯熟手概率为2.25,纯新人概率为2.31,两个单独的成分都明显不如两者结合。
这背后有直觉上合理的解释,研究团队在定性分析中也通过一个具体例子加以展示。在一次航空客服任务中,AI需要正确拒绝一个不符合政策的取消申请。当分析每个词元的信号时,可以清晰看到:纯熟手概率对"工具调用字符串"给出了偏低的得分——因为工具调用语法在自然语言中出现频率较低,模型对它们天然不自信。而进展优势则在同样的工具调用词元上给出了正面评分,因为新人对这些词元的概率更低,两者相除后优势值为正,正确反映了这些工具调用是"熟手相比新人更倾向做出的正确行动"。更引人注意的是,在涉及"退票政策"和"舱位等级"等关键业务约束词汇上,纯熟手概率给出了惩罚性评分,而进展优势则给出了奖励性评分,因为这些词汇正是熟手掌握了领域知识后才会主动引用的词汇。这个分析直观地说明了"两个模型对比"为何比"单个模型自评"更能捕捉到任务相关的信号。
七、参考策略的选取:远近之间有学问
研究还专门探讨了参考策略的选择空间。默认情况下,使用模型的原始预训练检查点作为参考策略,这是最直接的做法。然而,如果模型发布商没有公开基础检查点(这在业界相当常见),或者想进一步调优参考策略,是否有其他选择?
研究团队测试了一种"模型融合"方案:把训练后的最终模型与基础模型在权重空间中按照不同比例混合,得到一系列介于两者之间的"中间模型",用作参考策略。混合比例α从0.1到0.9变化,α=0对应纯基础模型,α=1对应纯训练后模型。同时,他们比较了两种融合算法:简单线性插值(WISE方法)和一种能处理参数干扰的鲁棒融合算法(TIES方法)。
结果显示,直接线性插值在大多数融合比例下反而降低了进展优势的质量,这符合预期——简单混合容易让参考策略和行为策略之间的差异变得混乱,信号价值下降。而TIES鲁棒融合则在α从0.2到0.7的宽泛范围内持续提升了进展优势的预测准确率,表明通过先进的模型合并技术,可以制造出一个"距离恰到好处"的参考策略,进一步增强进展优势的信号质量。这个发现为未来通过模型合并优化参考策略提供了新的思路,也与"进展优势对参考策略的距离很敏感"这一理论分析形成了实证呼应。
归根结底,这项研究揭示了一件颇具讽刺意味的事:研究者们花费大量资源训练AI,然后又花费大量资源为这些AI寻找评价工具,却没有意识到训练本身已经把评价工具内嵌其中。就像一家面包店花钱培训了烘焙师,又另请一位食评家来检验面包质量,结果发现只要对比这位烘焙师和学徒期时的出品,就能得到同样准确的质量判断。进展优势的贡献,正是点明了这件事:已经有了一对模型检查点,就已经有了评分器。
当然,这项研究也坦诚面对自身的局限。由于大多数商业机构不公开中间训练检查点,研究团队只能在开放了完整检查点对的模型上验证结论,样本规模存在一定约束。此外,现实中部署的模型是否完全满足KL-正则化强化学习的最优性条件,本身是难以严格验证的——研究团队假设公开模型接近这个最优点,但这一假设尚无充分实证支撑。研究也指出,进展优势目前在不同任务上的最优聚合策略并不统一,需要针对具体场景做一定调适,这在大规模自动化部署中增加了一些工程复杂度。
对于未来,研究团队提出了几个值得期待的扩展方向。其一,鼓励更多模型发布方公开完整的训练检查点链,让进展优势这类方法能够在更广泛的模型上得到验证和应用。其二,进展优势的框架并不限于文本模态,理论上可以推广到多模态智能体、机器人控制(视觉-语言-动作模型)以及具身智能体等场景,凡是经过RL训练且存在参考模型的系统,都可能从中受益。其三,进展优势也可以作为下一轮训练的反馈信号,形成自我改进的闭环——AI的行动在进展优势的评估下得到筛选,优质轨迹再流回训练过程,推动模型进一步提升。
说到底,这件事的核心不是某个复杂的算法,而是一种视角的转换:把训练当作一次性的投入,把训练的副产品当作可持续使用的资源。在AI系统变得越来越复杂、越来越难以监督的今天,从已有资源中发掘隐藏价值,是一种更为务实也更为可持续的研究路径。
Q&A
Q1:进展优势(Progress Advantage)和普通的置信度评分有什么本质区别?
A:普通置信度评分只看AI自身对某个词元的输出概率,但这个概率受语言习惯影响很大,比如常见词概率天然偏高,工具调用字符串概率天然偏低,和任务完成质量并不直接对应。进展优势则是用训练后的模型概率除以训练前的参考模型概率,这个比值过滤掉了通用语言习惯的影响,只保留了"训练过程中AI专门为了完成任务而调整的部分",因此与任务相关的动作质量更直接对应。
Q2:进展优势方法是否需要额外训练或标注数据?
A:完全不需要。进展优势只需要两个已有的模型检查点:一个是经过强化学习训练后的最终模型,另一个是训练前的参考模型(通常是基础预训练模型)。只要这两个检查点都已公开,就可以直接计算进展优势,无需任何额外训练或人工标注。计算过程也很简单,就是对同一段文本分别用两个模型做一次前向推理,取对应位置的对数概率之差。
Q3:进展优势只适用于语言AI,还是也能用于其他类型的AI系统?
A:从理论推导角度看,进展优势的成立条件只有两个:系统需要经过KL正则化(或等价约束)的强化学习训练,并且存在对应的参考模型检查点。这两个条件并不依赖于数据是文字、图像还是其他形式。因此,原则上多模态智能体、机器人控制中的视觉-语言-动作模型,乃至各种具身智能体系统,只要满足这两个条件,都可能从进展优势中受益。论文团队也将此列为重要的未来扩展方向。
好文章,需要你的鼓励
这篇论文提出一种插件式2D动作接口,让已训练好的3D运动语言模型无需修改或微调即可直接理解2D姿态输入。实验证明2D输入效果媲美3D输入,且在真实视频场景下配合专门的降噪适配器,2D方案比3D姿态估计更省算力、更实用,为动作理解模型的现实部署提供了新路径。
研究团队让8种AI智能体独立完成100项真实科研任务,深度剖析800份研究轨迹后发现,即便是最强模型,也普遍存在"发现问题却不修正"的现象,背后根源指向AI缺乏检验自身产出、主动纠错的元认知能力。
WorldRover是一套面向可探索世界建模的合成视频数据引擎,基于虚幻引擎构建,能让同一段探索轨迹在保持路线与场景一致的前提下,重新渲染为多种视角和外观状态,并同步提供深度、光流、长程点追踪等丰富标注,最终发布WorldRover-10M数据集,含2190万帧、202.7小时视频。
这篇论文指出,现有多目标强化学习训练大模型时存在"一刀切"分配优化精力的问题,提出SA-MRPO方法,根据每个奖励目标的饱和程度动态调整其权重,在数学推理、自适应推理、代码生成等任务上均取得优于现有方法GDPO的效果。