
这项由字节跳动Seed团队与密歇根州立大学联合开展的研究,发表于2026年7月,论文预印本编号为arXiv:2607.06987,有兴趣深入了解的读者可通过该编号查询完整论文。
当你训练一个会做数学题、会逻辑推理的AI大模型时,你会遇到一个棘手的两难困境——这个困境在过去几年里一直困扰着整个人工智能研究界,却始终没有一个令人满意的解决方案。这项研究的核心,就是发现了这个困境的根本成因,并提出了一套简洁而有效的解决办法。
为了让这个问题变得容易理解,不妨用一个关于学生学习的比喻来贯穿整篇文章。把AI模型比作一个正在备考的学生,把训练过程比作刷题练习。每次刷题之后,老师(训练算法)会根据学生的答题情况给出反馈,告诉学生哪些解题路径是对的、哪些是错的,然后学生据此调整自己的做题习惯。问题在于:如何在不破坏学生已有能力的前提下,让他敢于尝试那些冷僻但正确的解题方法?
一、一道困扰AI训练界多年的难题
先来理解AI推理训练的基本运作方式。当我们想让一个大型语言模型(可以理解为一个超级智能的文字处理和推理系统)学会解复杂数学题或者进行多步骤逻辑推理时,最常用的方式是强化学习。简单来说,就是让模型不断尝试回答问题,答对了就给"奖励",答错了就给"惩罚",模型通过反复试错,慢慢学会更好的解题策略。
但这里有个效率问题。最原始的强化学习方法(叫做REINFORCE)每做一批练习题,就必须把练习过的题目全部扔掉,重新从头生成新题目来练习。这就好像一个学生每道题只能看一眼,不能反复琢磨,效率极低。于是研究人员想出了一个聪明的办法:重要性采样(Importance Sampling,简称IS)。这个技术让模型能够把同一批练习题反复使用多次,通过一个叫做"重要性权重"的数学系数来修正不同时间做题的误差,大大提升了训练效率。
基于重要性采样发展出的现代算法,比如GRPO(群体相对策略优化)和DAPO(动态采样策略优化),已经成为训练推理型AI的主流工具,DeepSeek-R1、Qwen2.5-Math等著名模型都受益于这类技术。然而,就在这套体系看似完美的时候,一个深藏其中的矛盾开始浮出水面。
这个矛盾可以用"考场焦虑"来类比。重要性采样就像学生在考试时回忆过去练习的经验,但如果当前的解题思路和过去练习时的思路差距太大,回忆出来的经验就会产生严重失真,甚至把学生带偏。具体到AI训练中,当模型发现了一条以前从未走过的正确推理路径时,那条路径在历史记录中的"出现概率"极低,导致重要性权重变得极大,给出的梯度信号(告诉模型"朝哪个方向调整"的信号)会像脱缰的野马一样剧烈,直接把模型已有的能力破坏掉,造成所谓的"训练崩溃"。
为了防止这种崩溃,研究人员在GRPO和DAPO等算法中引入了一个"剪切机制"(Clipping)。这个机制给模型的每次调整幅度设置了一个上限,就像给缰绳装上了限位器,不管信号有多强烈,每次调整都不能超过一个预设的范围。
表面上看,问题解决了。但这项研究的团队发现,剪切机制本身又带来了一个新问题,而且这个新问题和之前的崩溃风险形成了一个难以逃脱的死循环。
二、"概率容量":给那个看不见的瓶颈命名
为了精确描述这个新问题,研究团队创造了一个新概念,叫做"概率容量"(Probability Capacity,简称Cap)。这个概念需要仔细解释,因为它是整篇论文最核心的洞察。
回到学生刷题的比喻。假设某个学生正在练习一道难题,他偶然发现了一种非常罕见但绝对正确的解题方法——这种方法他以前从来没用过,所以他在历史答题记录中使用这种方法的概率极低,比如只有1%。剪切机制规定,学生每次练习后对某种方法的"使用倾向"调整幅度,不能超过历史使用概率的一定比例。具体地说,在DAPO这个算法里,调整幅度最多只能是历史概率的1.28倍。
那么问题来了:历史使用概率是1%,乘以1.28,最多只能调整到1.28%。也就是说,这个学生对这种罕见但正确的解法,最多只能把信心从1%提升到1.28%。一旦超过这个阈值,剪切机制就会直接把学习信号砍成零,就好像老师在学生刚刚开始理解这种方法的时候,突然告诉他"停,不许再琢磨了"。
换成研究论文里的精确数字:一个历史出现概率只有0.01(即1%)的推理步骤,在DAPO的标准设置下(上限参数ε_high=0.28),最多只能把概率提升0.0028——也就是提升到1.28%之后,梯度就归零了,无论这个推理步骤有多正确、多重要,学习都会被强制叫停。
这个"概率容量"就是衡量一个推理步骤还能被学习多少的指标。对于那些正确但少见的推理路径(在复杂数学推理中,这类路径恰恰是最宝贵的),概率容量受到历史概率的严格线性约束,导致模型永远无法真正学会那些需要大幅跳跃才能掌握的新技巧。研究团队把这个现象称为"保守约束扼杀探索",它和前面说的"激进更新导致不稳定"共同构成了强化学习中的"探索-稳定两难困境"。
也就是说,不加限制的训练会崩溃,加了限制的训练会停滞,研究人员面对的是一个真正的两难局面。DAPO虽然通过引入不对称的上下限(正确答案和错误答案用不同的剪切幅度)做了一定改进,但从概率容量的角度分析,问题的根本结构并没有被打破,仍然被历史概率牢牢束缚。
三、破局之道:让正确答案的学习不再受历史束缚
研究团队提出的解决思路,灵感来自于那个最古老、最朴素的强化学习算法——REINFORCE。尽管这个老方法效率低下,但它有一个珍贵的数学性质:它的梯度计算完全不依赖历史概率,因此完全不存在概率容量被历史概率压制的问题。每一个正确的推理步骤,不管以前用过多少次,都能得到充分的学习机会。
问题在于,直接用REINFORCE就回到了低效率的老路。研究团队想到的方案是:能不能让现代高效算法的正确答案部分,在数学上等价于REINFORCE,而错误答案部分继续保留原来的剪切保护?
答案正是"无界正向非对称优化"(Unbounded Positive Asymmetric Optimization,简称UP)。
UP的核心机制用一个叫做"停止梯度算子"(stop-gradient operator,sg)的数学工具来实现。这个工具听起来很复杂,但原理其实简单:在计算"当前模型状态和历史模型状态之差"的时候,把分母里的历史概率偷偷替换成"当前概率的快照",并告诉计算机"这个快照在反向传播时不算变量,就当它是个常数"。
这样一来,当计算梯度时,分子是当前概率,分母也是当前概率的快照(在数值上完全相同,但不参与求导),两者相除永远等于1,整个重要性权重就变成了一个永远不会爆炸的稳定数字。然后对这个比值求导,经过一番代数化简,最终得到的梯度表达式和REINFORCE的完全相同——既没有历史概率的束缚,也没有梯度爆炸的风险。
用学生备考的比喻来说,UP相当于这样告诉学生:"做对题的时候,你就踏踏实实地把这种解法记深一点,不用管你以前用没用过这种方法,也不用担心提升幅度超了什么上限。" 这样,那些冷僻但正确的解题方法,就能得到应有的充分强化。
但对于做错题的情况,UP依然保留原有的剪切保护机制。这是因为,如果把错误答案也用同样的无约束方式来惩罚,会产生反方向的梯度爆炸,同样破坏模型的能力。研究团队通过消融实验(专门设计的对照实验)证实了这一点:一旦把无界更新同时应用于错误答案,模型在训练开始后仅仅25步就会彻底崩溃,梯度范数和KL散度(衡量模型偏离程度的指标)都会垂直飙升。
这种"对正确答案放开、对错误答案保守"的非对称设计,就是"非对称"这个词的由来。从概率容量的角度来看,UP使得正确答案的概率容量变成了一个简单的式子:当前概率距离最大值1还有多远,就有多少学习空间(Cap = 1 - 当前概率)。这个容量完全和历史概率脱钩,每个正确的推理步骤都始终有充足的学习预算,直到它的概率接近100%为止。
四、一个框架,三种算法:UP如何成为通用插件
UP框架真正的工程价值在于它的通用性——它不是专门为某一个算法设计的,而是可以像插件一样嵌入到任何基于群体相对优化思想的算法中。
以UP-DAPO为例,具体的做法是:每次训练时,对每个回答中的每个词(或者每一步推理),先判断这个回答整体是对的还是错的。如果是对的(优势值大于零),就用UP的无界对数概率目标来学习,也就是直接最大化当前概率的对数,不受任何上限约束。如果是错的(优势值不超过零),就保持DAPO原有的带剪切约束的重要性采样目标,照常限制更新幅度,防止过度惩罚。
UP-GRPO的做法完全类似,只是GRPO本来使用对称的单一剪切参数,并且有一个额外的KL散度惩罚项。UP-GRPO在正确答案上移除上限约束,改用无界对数目标,同时在错误答案上保留原有的对称剪切和KL惩罚。
UP-GSPO则展示了UP框架跨越不同优化粒度的能力。GSPO(群体序列策略优化)是一种以整个回答序列为单位进行优化的算法,和GRPO、DAPO那种逐词(逐token)优化的方式不同。对于序列级别的优化,研究团队通过严格的数学推导证明,UP在正确答案上的目标函数,经过代数化简后,等价于一个带有长度归一化的REINFORCE梯度——同样既不受历史概率约束,也不会引发梯度爆炸。对于错误答案,则继续使用原始GSPO的序列级剪切机制作为保障。
这个"无论逐词还是逐句,无论对称剪切还是非对称剪切,都能接入"的特性,让UP具备了真正的即插即用价值。
五、实验数据:探索能力和稳定性真的可以兼得
研究团队在多个维度上对UP框架进行了验证,每个实验都对应着一个值得细细品味的故事。
第一个核心实验是在Qwen3-14B-Base(一个参数规模为140亿的稠密型大语言模型)上对比DAPO和UP-DAPO。整个训练过程大约持续150步,模型在AIME24(美国数学邀请赛2024年题目)这个极具挑战性的数学竞赛数据集上接受评测。
从性能曲线来看,两条曲线一开始走势相似,但随着训练步数推进,UP-DAPO逐渐拉开差距。最终,在每次生成32个答案然后取平均准确率(Avg@32)这个指标上,UP-DAPO达到了51.15%,而标准DAPO只有47.71%,差距约3.4个百分点。在多数投票准确率(Maj@32,32个答案中投票选出最常见的那个)上,UP-DAPO达到60.88%,DAPO为58.36%。特别有意思的是,性能差距在训练后期明显扩大,说明UP-DAPO的提升是持续性的,而不是短暂的波动。
为了理解这个性能提升从哪里来,研究团队还专门测量了两个算法在训练过程中的"探索能力"。探索能力用一个叫做"熵"的物理量来衡量——熵越高,说明模型生成答案时的多样性越强,尝试的解题路径越丰富。从实验曲线上看,UP-DAPO的熵在整个训练过程中始终高于DAPO,而且两者的差距随时间逐渐扩大,直观地说明了UP确实成功地"解放"了模型的探索空间。
进一步地,研究团队还测量了Best@32(32次尝试中至少有一次答对的概率),这个指标直接衡量"探索能力的上限"。UP-DAPO的Best@32峰值为81.79%,优于DAPO的80.49%。这意味着UP让模型有更大概率在多次尝试中发现正确解法,哪怕这个解法原本很冷僻。
而在稳定性方面,数据同样令人信服。UP-DAPO的梯度范数(衡量每次训练调整幅度的指标)和KL散度(衡量当前模型与参考模型之间偏离程度的指标)全程都和标准DAPO处于同一量级,甚至略低。这说明探索能力的提升完全没有以稳定性为代价。
研究团队还做了两个关键的消融实验来验证UP的设计选择。一个实验是把DAPO的上限剪切参数直接设置为无穷大(ε_high = ∞),也就是"只移除上限、不用停止梯度算子"。结果显示,这个版本在训练约80步之后发生了严重崩溃,梯度范数飙升到10^13的量级,KL散度也随之暴涨。这有力地证明了停止梯度算子的不可或缺性:仅仅移除约束是不够的,必须从根本上改变历史概率作为锚点这个机制,才能安全地实现无界学习。另一个实验则验证了非对称设计的必要性:把无界更新同时应用于正确和错误答案的"对称无界"版本,在训练仅25步内就完全崩溃,彻底证实了对错误答案保留剪切保护的重要性。
在与其他十一种算法的大规模横向比较中,研究团队使用了统一的实验设置,在Qwen3-8B(80亿参数)模型上用MATH数据集(Level 3-5,中等到较难难度)训练,然后在五个不同的数学推理基准上评测:AIME24(美国数学邀请赛)、AMC23(美国数学竞赛)、MATH500(500道综合数学题)、Minerva(定量推理)和OlympiadBench(奥林匹克级别多学科题目)。
参与比较的算法涵盖了目前主流的几乎所有强化学习训练方法,包括GRPO、Dr.GRPO、CISPO、DPPO、GMPO、GSPO、SAPO、REINFORCE++、RLOO、W-REINFORCE和ASPO。UP-GRPO以61.31%的平均准确率位居第一,超过了排名第二的GSPO(60.15%)1.16个百分点。在五个单独基准上,UP-GRPO在四个上排名第一或并列第一(AIME24: 41.04%、AMC23: 87.50%、MATH500: 88.40%、Minerva: 31.25%),在OlympiadBench上以58.33%排名第二,仅次于ASPO的58.48%。
从熵曲线的对比来看,参与比较的大多数算法(包括GRPO、Dr.GRPO、CISPO、DPPO、GMPO、GSPO、SAPO、REINFORCE++和RLOO)都出现了明显的"熵崩塌"——随着训练推进,模型生成答案的多样性越来越低,探索空间越来越窄。在所有方法中,只有UP-GRPO、W-REINFORCE和ASPO避免了熵崩塌,而这三个方法恰恰都采用了对正确和错误答案进行非对称处理的设计思路。这个观察从侧面有力地印证了非对称优化是维持长期探索能力的关键结构性要素。
UP的通用性还通过两个额外的实验得到验证。一个是在Qwen3-30B-A3B-Base(参数规模300亿、激活参数30亿的混合专家模型,MoE架构与稠密架构有本质区别)上测试UP-GSPO。UP-GSPO达到了55.73%的Avg@32峰值,相比基准GSPO的52.71%提升3.02个百分点,KL散度全程保持稳定。另一个是在Qwen3-VL-8B-Instruct(视觉-语言多模态模型)上用几何图形推理数据集Geometry3K测试UP-GRPO。这个数据集要求模型同时理解几何图形的视觉信息和文字描述来解题,是对多模态能力的考验。UP-GRPO在几何题测试集上达到62.60%的峰值准确率,超过标准GRPO的59.30%达3.30个百分点,KL散度同样保持稳定。这两个实验说明UP框架在不同模型架构(稠密模型、MoE模型、视觉-语言模型)和不同训练数据(语言推理、视觉几何推理)上都能稳定生效。
说到底,这项研究解决的问题可能听起来很抽象,但它的意义落地到现实世界是相当直接的:我们日常使用的AI助手和推理工具,背后的能力很大程度上取决于训练时能否有效学习那些"偶尔用到但至关重要"的推理技巧。UP框架提供的,正是一种让AI在不冒崩溃风险的前提下充分掌握这类技巧的训练方式。
这个方法的另一个值得关注的特点是轻量。它不需要修改模型结构,不需要额外的数据或计算资源,只需要在训练目标函数上做一个简洁的数学改动,就能带来持续的性能提升。而且,从GRPO到DAPO再到GSPO,它能够无缝接入现有的主流训练框架,这意味着任何已经在用这些算法的研究团队都可以以极低的成本尝试UP。
当然,这项研究也有一些值得继续探索的开放问题。目前的实验主要集中在数学推理领域,UP在代码生成、常识推理、多轮对话等其他任务上的表现还有待验证。此外,停止梯度算子带来的"自锚定"效果虽然在数学上等价于REINFORCE,但在不同类型的奖励信号(比如人类偏好反馈而非规则性的对错判断)下,其稳定性边界也值得进一步探究。
归根结底,这项研究给了我们一个清晰的提醒:有时候,解决一个复杂问题最优雅的方式,不是修补现有框架的某个零件,而是退一步看清楚是哪个底层假设在悄悄制造麻烦,然后直接把它换掉。想继续深挖细节的读者,可以通过arXiv编号2607.06987找到完整论文。
Q&A
Q1:什么是强化学习中的"探索-稳定两难困境"?
A:训练AI推理模型时存在一个矛盾:不加限制地学习新推理路径容易让模型训练崩溃,而为了防止崩溃加入的"剪切机制"又会把正确但罕见的推理路径的学习空间压缩到极低,导致模型无法充分掌握那些冷僻但重要的解题技巧。两个问题互相掣肘,就构成了所谓的探索-稳定两难困境。
Q2:UP框架中的停止梯度算子具体是怎么起作用的?
A:停止梯度算子的作用是把重要性采样比率中的历史概率分母,替换成当前概率的一个"快照副本",并告诉计算过程"这个副本在求导时当作常数处理"。这样一来,分子分母在数值上相等,比值始终为1,彻底消除了历史概率过低时导致比值爆炸的根本原因,同时数学上推导出的梯度形式和REINFORCE完全等价。
Q3:UP方法和ASPO、W-REINFORCE这些也做了非对称处理的方法有什么本质区别?
A:ASPO和W-REINFORCE同样对正确和错误答案采用不同策略,但它们的正确答案部分仍然保留了历史概率作为分母的重要性采样结构,只是调整了权重或约束方式。UP通过停止梯度算子从根本上移除了历史概率对正确答案学习的约束,使概率容量完全脱离历史概率的线性束缚,这是更彻底的结构性改变。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。