微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 中国人民大学、中科院、浙江大学联合探索:换个"优化器",AI训练效率提升88%?

中国人民大学、中科院、浙江大学联合探索:换个"优化器",AI训练效率提升88%?

2026-07-29 17:16
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-29 17:16 科技行者

这项由中国人民大学高瓴人工智能学院、独立研究者、中国科学院计算技术研究所、杜克大学、中国科学院自动化研究所以及浙江大学计算机科学与技术学院联合完成的研究,于2026年7月以预印本形式发布于arXiv,编号为arXiv:2607.16169v1。感兴趣的读者可通过该编号查阅完整原文。

训练一个能干活的AI智能体,就像培养一个能独立完成家务的机器人助手。你得教它认识环境、理解任务、一步步执行操作,直到最终完成目标。然而,这个"培训过程"本身有着极大的改进空间——用什么方式来"纠正"AI的错误,用什么节奏来调整它的行为,都深刻影响着最终能培养出多优秀的助手。这篇论文的核心问题,正是关于这个"纠正方式"的选择。

研究团队专注于一个看似技术细节、实则影响深远的问题:当我们用强化学习(一种让AI通过反复试错来学习的方法)来训练智能体时,用一种叫做"Muon"的新型优化器,是否比传统的"AdamW"更有效?结果出乎许多人的意料。

一、先搞清楚"优化器"是什么

要理解这项研究,首先得明白"优化器"扮演的角色。可以用学钢琴来做类比:AI模型就像一个钢琴学生,每次弹错了,需要有人告诉它哪里错了、怎么改。这个"告诉它怎么改"的机制,就是优化器。

AdamW是目前AI训练中最常用的优化器,就像一位经验丰富的钢琴老师,它会针对每一个手指(模型的每个参数)单独分析,根据这根手指最近的表现来决定它该调整多少。这种"逐个细调"的方式在很多场景下效果很好。

Muon则是一种较新的优化器,它的思路有所不同。它不单独看每根手指,而是看整只手的"姿势结构"——从数学上来说,它会对所有参数的更新方向做一种叫"谱归一化"的处理,粗略地理解,就是把强的方向和弱的方向拉到同一水平线上,让每个方向的调整都相对均衡。这个过程通过一种叫"牛顿-舒尔茨迭代"的数学技巧来实现。

在大规模预训练(就是从头开始训练超大模型)中,Muon已经展现出很大优势——有研究表明,用Muon训练一个十亿参数规模的大模型,只需要AdamW一半左右的计算量就能达到同样效果,甚至还被用于万亿参数级别的超大模型训练。然而,没有人系统研究过:在强化学习阶段(也就是让AI通过试错来学技能的阶段),Muon是否同样有效?这正是本文要回答的问题。

二、测试场景:让AI在虚拟房间里干家务

研究团队选择了一个名为ALFWorld的虚拟环境作为测试场。ALFWorld是一个文字描述的家庭场景模拟器,AI需要理解诸如"把苹果放进冰箱"这样的任务,然后一步步执行:先找到苹果,再找到冰箱,打开冰箱门,放进去。任务分为六大类:拿取物品、查看物品、清洁物品、加热物品、冷却物品,以及同时拿取两件物品。

这类任务有几个特点使它特别有挑战性。第一,每个任务最多需要50个步骤,是典型的"长期决策"任务。第二,奖励非常稀少——只有在成功完成整个任务时才会得到正向奖励,中途做了大量正确操作也不会立刻得到鼓励,就像参加一场考试,只有交卷后才知道分数,过程中没有任何提示。第三,动作格式有严格要求,如果AI输出了格式不对的指令,会受到小小的惩罚。

被训练的AI模型是Qwen2.5-0.5B-Instruct,这是阿里巴巴开发的一个5亿参数规模的语言模型。研究在8块英伟达H20显卡上进行,总共训练200轮,每5轮进行一次测试,测试时评估128个任务的完成率。

三、三种不同的"评分方式"产生了截然不同的结果

强化学习的核心,是如何告诉AI它做得好不好——这就是"优势估计"的问题。研究团队比较了三种不同的评分方式,理解这三者的区别,是理解整篇论文结果的关键。

第一种叫GRPO(来自深度求索数学推理团队的工作),用最简单的方式评分:完成任务得分高,没完成得分低,把同一批任务的得分做个对比,每条完整轨迹(从开始到结束的整个过程)只得到一个总评价。这就像给一场足球比赛只看最终比分,赢了全队都好,输了全队都差,至于哪个球员在哪个时刻做了关键贡献,完全不区分。

第二种叫GiGPO(来自NeurIPS 2025的工作),在GRPO的基础上增加了一个"步骤级别"的评分。它的聪明之处在于:在不同的训练轨迹中,AI经常会遇到完全相同的中间状态(比如都走到了厨房门口)。GiGPO把所有在同一个状态下做出的不同选择收集起来,横向比较这些选择各自带来的后续结果,从而给每一步单独打分。这就像不只看比赛结果,还分析每个球员在每一次跑位时的表现——站对位置的球员得分高,站错位置的得分低。

第三种叫GraphGPO(被ICML 2026接收),走得更远。它把所有训练轨迹里出现过的状态和转移关系整合成一张大的"状态转移图",然后根据每个状态离任务目标的距离来打分——离目标越近的状态,越有价值,越应该被强化。这就像有一张完整的地图,知道每个位置距离终点有多远,每次移动是靠近终点还是远离终点,都可以精确计算。

这三种方式代表了从粗到细的三个层次:只看最终结果、看每个中间步骤、看整体结构中每次转移的价值。

四、Muon的表现:惊喜与差异并存

研究团队的做法很干净利落:只把模型内部矩阵参数(注意力机制和前馈网络的权重矩阵)换成Muon来更新,而嵌入层、归一化层等其他参数仍然保持用AdamW更新。这种"混合配置"是Muon的标准用法,因为Muon本就是为矩阵参数设计的。

在GiGPO框架下,这一改动带来了最显著的提升。以最终20%训练阶段(第175到200轮)的平均测试成功率来衡量,AdamW是0.290,而Muon达到了0.546,相对提升幅度高达88%。在最后一个检查点,AdamW成功率是0.320,Muon达到了0.633,差不多是两倍的差距。从整条训练曲线来看,Muon从大约第50轮开始就持续领先,且领先优势随着训练推进而不断扩大,最终呈现出一条稳步攀升的漂亮曲线,而AdamW的曲线则相对平坦。

六大任务类别中,GiGPO+Muon在冷却物品、同时拿取两件物品和加热物品这三类任务上的提升最为突出。没有哪个任务类别单独拉高了整体数字,改进是广泛分布的,说明这不是偶然的个别现象。

在GRPO框架下,Muon同样有改善,但幅度小得多。最终窗口均值从0.161提升到0.268,相对提升约67%。然而,如果看整条训练曲线的面积(研究中称为"归一化验证AUC"),提升几乎可以忽略不计,从0.08到0.09。这说明大部分改善集中在训练后期,Muon在训练前中期的优势并不明显。

在GraphGPO框架下,情况又有所不同。由于GraphGPO本身的评分机制更精细,AdamW的基准表现就已经相当不错(0.810),留给Muon"超越"的空间自然更小。当Muon学习率设为3×10^-5时,最终窗口成功率从0.810小幅提升到0.828;当学习率降低到1×10^-5时,最终窗口成功率达到0.901,但更值得关注的是:整条训练曲线的AUC从0.399提升到0.556,并且达到50%和75%成功率的时间分别提前了30轮和60轮。也就是说,在GraphGPO下,Muon的优势主要体现在"学得更快",而不是"最终学得更好"——因为最终两者都接近上限了。

五、一个重要的排除实验:单纯提高学习率有用吗?

有一种可能的质疑声音是:也许Muon的优势只是因为它使用了更大的学习率(相当于更激进地调整AI的行为),换成AdamW用同样大的学习率是不是也能达到同样效果?

研究团队专门做了这个排除实验。他们在GiGPO框架下,测试了AdamW在1×10^-5和3×10^-5两个较高学习率下的表现。结果非常明确:两个高学习率版本的AdamW在整个训练过程中几乎从第5轮开始就完全失效,测试成功率归零并维持到第200轮结束。诊断数据显示,这两个版本的AI响应长度饱和(每次都生成最长的可能回复,把所有可用长度用满)、有效动作率崩溃(生成的指令越来越多格式错误),同时KL散度(衡量模型偏离初始状态程度的指标)出现大幅波动。简而言之,更高学习率的AdamW把模型"训坏了",而Muon在同样高的学习率下却能稳定运行200轮并持续改善。

这个对比非常有力地说明:Muon的优势不仅仅来自学习率的数值大小,更来自其更新方式本身。Muon的谱归一化机制提供了某种稳定性,防止了高学习率下常见的训练崩溃。

六、步骤级评分和Muon各自贡献了什么?

为了精确区分"是GiGPO的步骤评分有用"还是"是Muon有用",研究团队做了一个2×2的完整对比实验。他们同时控制了两个变量:优化器(AdamW还是Muon)和是否启用步骤级评分(ω=0代表只用轨迹级评分,ω=1代表启用步骤级评分)。

结果显示了一个有趣的"双赢"图景。仅看是否启用步骤评分的影响:AdamW在关闭步骤评分时成功率为0.141,开启后提升到0.290,几乎翻倍;Muon在关闭时为0.361,开启后提升到0.546,同样大幅提升。再看同一评分方式下换优化器的影响:在关闭步骤评分的条件下,Muon比AdamW高出0.220;在开启步骤评分的条件下,Muon比AdamW高出0.255。两个维度各自都有显著贡献,而且它们加在一起的效果似乎大于简单相加——更细致的评分和更好的优化器可能存在某种相互增强的关系。

七、为什么会这样?一个关于"信号质量"的猜想

研究团队提出了一个理论框架来解释观察到的现象,虽然这只是一个猜想,尚未得到直接实验验证,但逻辑上颇具说服力。

核心思路是这样的:每次训练迭代中,AI实际收到的梯度信号(关于"如何修改参数"的信息)可以分为两部分:真正有用的"信号"和无关的"噪声"。在长达50步的任务中,假设真正影响任务成败的关键决策只有K个,但整条轨迹有T个步骤。如果只用最终结果来评分(GRPO的做法),那么所有T个步骤都会被赋予同样的权重,其中T-K个非关键步骤就成了噪声来源。而步骤级评分的意义,就在于尽可能区分出哪些步骤真正重要,从而提高整体信号质量。

Muon的更新方式会把所有方向的更新幅度拉平:原本强势的方向被压低,原本微弱的方向被放大。这在信号质量高的时候非常有用——那些微弱方向往往包含被噪声掩盖的真实信号,放大它们有助于学习。但在信号质量低的时候,微弱方向可能只是纯噪声,放大噪声就会适得其反。

研究团队用一个数学公式来表达这个直觉:假设梯度矩阵中第i个方向的信号强度为si、噪声标准差为σi,那么Muon的极化更新与真实信号的对齐程度,正比于各个方向信号噪声比si/σi的函数之和。信号噪声比越高,Muon就越有用;信号噪声比太低,Muon就可能帮倒忙。

这个猜想能够统一解释论文中的所有观察:在长视野任务(而非单轮问答)中,加上步骤级评分(提升信号质量),Muon的优势最为明显;在GraphGPO这个评分更精细的框架下,即使是AdamW的表现也已经很好,Muon的边际贡献因此缩小;而之前其他研究中Muon在强化学习中失败的案例,恰好集中在单轮任务、纯结果评分的低信噪比场景。

这个猜想还给出了具体的可验证预测:用更细致的评分方式,应该能在训练早期(而非只在训练后期)就体现出优势,因为它改善的是整条训练曲线的效率。这与观察到的"GraphGPO+Muon在时间门槛上提前30-60轮"高度吻合。

八、诚实面对局限

这篇论文的研究者非常坦诚地说明了研究的局限性。整个实验是单次随机种子运行的结果,这意味着观察到的数字代表的是个别轨迹,而非统计意义上稳定的群体规律。换句话说,如果换一个随机种子重跑,结果可能有所不同。

学习率的覆盖范围也比较有限:GiGPO和GraphGPO各测试了两个Muon学习率,GRPO只测试了一个,没有进行系统性的大范围扫描。AdamW的高学习率控制实验也只在GiGPO下进行,没有扩展到其他框架。

所有实验都只用了一个0.5B参数的小模型,在ALFWorld这一个任务环境下进行。更大的模型、更多样的任务环境是否会复现同样的结果,尚不清楚。此外,由于全矩阵不分片的实现方式,当前方案在扩展到更大模型时面临显存挑战,需要分布式版本的Muon才能解决。

机制方面的证据也纯属相关性,没有直接测量梯度更新的频谱、有效秩或信噪比,所有理论分析都是"猜测性框架",而非经过验证的因果机制。

说到底,这项研究的价值更多在于"打开了一扇门"——它说明Muon在强化学习后训练阶段是值得认真对待的选项,而不是一个已经盖棺论定的最优解。它证明了之前"Muon不适用于强化学习"的负面结论是有条件限制的,在合适的任务结构和评分机制下,Muon可以带来相当可观的改进。

更重要的发现可能是,优化器的选择和评分机制的设计应该被视为一个整体来考虑,而不是两个可以独立调优的旋钮。当两者的特性相互匹配——精细的信用分配遇上善用微弱信号的优化器——才能发挥出最大潜力。未来的研究需要更多随机种子、更大的模型、更多样的任务,以及真正测量梯度频谱的实验,才能把这个猜想变成扎实的结论。

Q&A

Q1:Muon优化器和AdamW优化器的根本区别是什么?

A:AdamW对每个参数单独调整更新幅度,就像针对每根手指单独调整力度;Muon则对整个权重矩阵的更新方向做"谱归一化",把强方向压低、弱方向放大,让所有方向的调整幅度趋于均衡。这种特性在信号质量高的场景下有助于发现被噪声掩盖的有用信号,但在信号噪声比低的场景下也可能适得其反。

Q2:为什么高学习率的AdamW在GiGPO实验中会直接训练失败?

A:当AdamW使用1×10^-5或3×10^-5的学习率时,每次参数更新的步长过大,模型偏离初始状态过快,出现了KL散度暴涨、生成响应长度饱和、有效动作率崩溃等一系列连锁反应,AI几乎从第5轮开始就失去了正常完成任务的能力,成功率归零且一直维持到训练结束。而Muon在同样数值的学习率下却能稳定运行,说明其谱归一化机制本身提供了某种对大步长的抵抗力。

Q3:GiGPO、GRPO和GraphGPO三种方法中,哪种和Muon的配合效果最好?

A:从最终成功率的绝对提升来看,GiGPO配合Muon的效果最显著,最终窗口成功率从0.290提升到0.546,相对提升88%;从整条训练曲线的学习效率来看,GraphGPO配合Muon的AUC提升最大,并且能将达到关键成功率门槛的时间提前30至60轮。GRPO与Muon的配合有改善但幅度最小,且主要集中在训练后期。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-