
你可能没意识到这件事有多反直觉。
一个经过强化学习训练的AI模型,单次做题的正确率能提升五十多倍,可是让它多做几次同一道题,它给出的解法却越来越单一。你会觉得,模型变强了,应该是越来越会举一反三才对,怎么反而变得像个只会一种套路的偏科生?
这正是这篇论文要挖的坑。研究者们盯上了一个叫Countdown的数字游戏,用几个整数通过加减乘除凑出目标数字。这个游戏有个特别的好处:它的所有正确解法都能被穷举出来。你不需要靠猜、靠采样去估计模型到底掉了多少种解法,而是可以像查户口一样,把每一种可能的解法列个清单,再对照模型实际生成了哪些。
这种可穷举性,让研究者能做一件之前没人做成的事:精确定位AI在解题的哪一步走丢了。
**门口的选择,还是路上的失误**
先说清楚这篇论文想搞明白的核心矛盾。
**强化学习与可验证奖励**(RLVR,Reinforcement Learning with Verifiable Rewards):一种训练方式,让AI模型反复尝试解题,只有答案被验证为正确才给奖励,通过这种试错让模型越来越擅长得到正确答案。
这套方法现在是训练AI做数学题、编程题的主流路子。DeepSeek-R1、Qwen系列的强推理模型,背后都有它的身影。但同时,业界也在用另一套武器提升AI的表现:让AI对同一道题生成很多个答案,再从里面挑一个最好的,或者投票选出最多人赞成的答案。这套武器有个名字。
**测试时扩展**(test-time scaling):不改变模型本身,而是在回答问题时让它多想几遍、多算几次,靠"多次尝试"换取更高的正确率,比较常见的做法包括重复采样、自洽性投票、树搜索等。
这两套武器本该是互补的,但论文发现它们其实在打架。RLVR越训,模型的解法越单一,那测试时扩展的"多次尝试"就越没意义,因为多次尝试出来的答案都长得差不多,等于白费功夫。
问题是,没人说得清这种解法收窄到底发生在哪个环节。是模型压根不知道还有别的路可以走,一开始就没往那个方向迈出第一步?还是它迈出了第一步,走到中途却算错了,没能走到终点?
这两种情况天差地别。前者是"没进门",后者是"进门以后在屋里迷路了"。如果是前者,那你得想办法让模型愿意去开那扇门;如果是后者,那你得帮它把屋里的路走顺。混着谈,只会开错药方。
论文用一个精巧的比喻式框架来拆解这个问题,他们把这道题的"入口"定义为一个具体的概念。
**入口家族**(entrance family):在Countdown游戏里,一道题的正确解法可以按照它"第一步用的数字和运算符号"分组,比如面对{4,5,7,9}凑24,"用4乘以某个数开头"就是一个入口家族,这个家族下面还可能分出"4乘7"和"4乘9"两条不同的后续路径。
打个比方,如果把解一道数学题想象成走进一栋大楼找宝藏,那么入口家族就是大楼的每一个门。宝藏藏在楼里的很多个房间,每个房间对应一种具体解法,而每个房间的入口都归属于某一扇大门。研究者想搞清楚的是:AI训练之后,是它压根不推开某些门(access,进入门槛),还是它推开了门,进了房间以后却在里面转晕了找不到宝藏(execution,执行能力)?
**准确率涨了五十倍,解法却掉了三分之二**
研究者先用两套完全独立的强化学习流程各跑了一遍,一套是自己用PPO算法训练Qwen2.5-3B模型,另一套是拿开源的用GRPO算法训练出来的Qwen2.5-3B-Instruct模型系列。两套流程用的算法不同、模型底座也有差异,如果两边都出现同样的现象,那说明这不是某个算法的特有毛病,而是RLVR训练这件事本身自带的副作用。
**PPO**(Proximal Policy Optimization,近端策略优化)和**GRPO**(Group Relative Policy Optimization,组相对策略优化):都是强化学习里常用的训练算法,简单说就是让模型在尝试解题的过程中,根据表现好坏调整自己"生成答案"这个行为的概率分布,GRPO是近两年在大模型推理训练里流行起来的一种改进版本。
结果非常扎眼。PPO训练的模型,从50步训到275步,单次做对的概率(pass@1)涨了五十多倍,但如果把它在同一批测试题上生成320次答案,统计一下这些答案覆盖了整个正确解法空间的多大比例(论文管这个叫solution coverage,解法覆盖率),这个数字从0.337掉到了0.111,足足跌了67%。GRPO那套开源模型也一样,准确率翻了三倍多,解法覆盖率却掉了43%。
更扎心的是,研究者专门挑出那些"训练前后都能解出来"的题目做对照,排除掉"模型只是变笨了不会做这道题"这种混淆因素。在这批题目里,早期checkpoint找到的正确解法,只有31%在后期还能被模型重新生成出来。覆盖率从0.564掉到0.286,而且没有一道题是早期做不出来、后期反而学会了新解法的。
这说明什么?这说明RLVR训练并没有让模型学会更多解题思路,而是把它原本会的那些路子,狠狠地压缩到了一条独木桥上。
那这种压缩,是均匀发生在解题全程,还是集中在某个环节?研究者按照不同的分类方式切开正确答案集合,发现越靠近"第一步选择"的分类维度,覆盖率掉得越狠。粗粒度的"运算符类别"覆盖率掉了一半,细粒度的"第一步具体是哪两个数字先运算"这个维度,覆盖率直接掉到只剩三分之一。这个信号已经很明显了:问题出在开局,不是出在中盘。
**用"教师强制"给模型的每个词打分,发现门口的概率塌陷得最狠**
要精确锁定问题出在哪一步,研究者用了一个技巧,叫**教师强制**(teacher forcing):给模型一段已经写好的、正确的解题过程,让它逐词去"打分",看它给这段文字里每一个词分配的概率是多少,而不是让它自己生成。
这个方法的好处是,它不需要模型自己独立答对题,只是评估模型有多"认可"一条给定的正确路径。研究者把这些正确路径,按照"进入第一次运算之前"和"进入第一次运算之后"切成两段,分别看训练前后模型对这两段文字的概率打分变化多大。
结果是,在"进入第一次运算之前"这一段,每个词的负对数似然(可以理解成模型对这个词的"意外程度")在训练前后差了4.50,而在运算开始之后的执行阶段,这个差值只有0.28,前者是后者的16倍。GRPO那套模型上做同样的实验,倍数是11倍。
如果把模型生成答案的过程想象成开车走一条路,教师强制打分就像是让司机重新走一遍地图上标好的路线,看他在每个路口犹豫了多久。研究者发现,司机在"要不要拐进这条巷子"的路口犹豫得特别久,概率大幅下降,一旦真的拐进巷子之后,他走巷子里剩下的路反而走得很顺,速度没什么变化。这说明司机不是不会走巷子里的路,是他压根不太想拐进去了。
那如果强行把司机塞进巷子口呢?研究者做了这个实验,给模型一个极简的提示,只写出正确解法应该用哪个数字、哪个运算符开头,类似"让我试试:4 乘",后面完全不给任何提示。结果在PPO的晚期checkpoint上,这种"入口提示"让模型在指定家族里完成正确解法的概率,从自由生成时的0.018,直接跳到0.212,提升了十倍多,效果几乎等同于把整个第一步运算都直接告诉它。GRPO那边也复现了同样的现象,从0.104涨到0.188。
这就好比一个人本来会做某道菜,但因为很久没做过,已经不记得从哪一步下锅了。你只需要提醒他"先把油倒进锅里",他立刻就能接着把整道菜做完,而且做得又快又好。他缺的不是手艺,是那个开头的提示。如果你不给这个提示,他就宁愿一直做他最近反复练熟的那道菜,哪怕食材摆在眼前,他也想不起另一道菜该怎么起锅。
更绝的一个实验是,研究者把这种极简提示直接嫁接进模型自己已经失败的答题过程里,也就是说,让模型先按自己的方式尝试、失败,然后在它卡壳的地方插入一句"入口提示",接着让它继续往下写。这种情况下,完成正确解法的概率是0.176,而不给任何提示、纯粹让它自己重试的对照组,概率只有0.044。这说明,即便是在模型自己走出来的、已经出错的思维轨迹里,那扇被锁住的门依然能被一句轻轻的提示重新打开。
研究者还专门挑出28个"在早期checkpoint出现过,但在后期320次自由采样里一次都没出现"的入口家族。给这些几乎绝迹的家族一个极简入口提示,后期模型完成它们的概率是0.529,甚至比早期checkpoint自己的表现(0.475)还高。换句话说,这些路径没有被遗忘,只是没人去敲那扇门了,一旦有人敲,它照样能开。
**表面上换个说法没用,真正管用的是往模型里"注入"早期的记忆**
既然问题定位在入口,那么合乎逻辑的下一步就是:干预手段应该瞄准入口,而不是瞄准答案的表面形式。
研究者先试了几种表面功夫。直接在提示词里要求模型"换一种方法解题",这种**提示工程**(prompt engineering,通过调整输入给模型的文字描述来影响输出结果)几乎没用,解法覆盖率只涨了0.014。强行指定一个不同的开头运算符,但不给具体的数字状态,也没用,覆盖率反而掉了0.007。提高生成时的**温度参数**(temperature,控制模型生成文字时随机性大小的一个数值,越高越"敢"选择低概率的词)确实能让覆盖率涨一点,但代价是单次答对的概率跌了,从0.278掉到0.264,这属于拿准确率去换多样性,不是真正的解决办法。
真正有效的,是直接在模型内部"掺"一点早期checkpoint的信息进去。研究者试了一种叫**层插值**(layer interpolation)的手段,把训练后期模型第20到28层的参数,和训练早期第50步checkpoint的对应参数各取一半、线性混合起来,其余层保持后期的参数不变。这一招把解法覆盖率从0.111提升到0.152,提升了37%,而且单次答对的准确率不但没降,反而涨到了0.305。
这就像给一个人做记忆修复手术,不是把他整个人换回从前,而是只挖出大脑里"决定往哪走"的那一小块区域,注入年轻时候还没被磨平棱角的记忆,其他部分,比如手上的技艺、算术能力,一点没动。这样他既保留了训练后学到的熟练操作,又找回了当年愿意尝试不同路线的勇气。
如果不做这种精准的层级混合,而是简单粗暴地把整个模型换成早期版本,或者只在答案文字部分做混合,效果都很有限,甚至会拖累准确率。这说明起作用的关键,恰恰是"混合的位置对不对",而不是"混合的比例大不大"。
还有一种更省事的办法,是在测试的时候,不依赖模型自己去探索,而是人为地把采样次数平摊到每一个已知可行的入口家族上,强制模型对每个可能的开头都试一试。这在早期checkpoint上没有明显优势,因为那时模型本身探索得就够广,可一到晚期checkpoint,这种"强制分配"就立刻显现出价值,覆盖率提升了0.077,涉及的入口家族数量多探索了0.430个。这恰好印证了理论预测:只有当模型自身的探索意愿已经塌陷之后,外部强制分配才真正有用武之地。
**这事在更大的模型、更复杂的题目上一样发生**
Countdown游戏毕竟是个人为简化的场景,题目简单、解法能穷举。研究者接下来要验证的问题是,这套"入口收窄"的现象,会不会只是Countdown这个小实验室里的特例。
他们在GSM8K、MATH500、Minerva Math、OlympiadBench、AMC23、AIME24这六个标准数学基准测试上,用7B和14B规模的Qwen2.5模型做对照实验。因为这些题目的正确解法没法像Countdown那样穷举列出来,研究者改用了一个**结构代理指标**(structural proxy):既然没法直接数有多少种正确解法,那就去看模型给出的"第一步计算"到底有多少种不同的形式,以此近似衡量开局的多样性。
结果和Countdown高度一致。经过SimpleRL(一种RLVR训练方法)训练之后,7B模型的准确率涨了13%,14B模型涨了17%,可是"第一步计算"的多样性(用信息熵衡量)分别掉了30%和41%,不同解题轨迹的比例几乎减半。研究者还专门做了一个更精细的验证,把训练前后的模型放在同一条参考解法上打分,发现"第一步计算之前"的概率变动幅度,始终比"计算之后的执行阶段"大得多,这个现象在六个基准测试上无一例外。
有个具体的例子特别能说明问题。GSM8K数据集里有一道题,讲亨利想烤比去年多一倍的饼干,结果多烤了15个,又摔碎了5个,最后剩110个,问去年烤了多少个。这道题存在至少三种解法思路:一种是从最终结果倒推回去(110加5减15再除以2),一种是列代数方程正向求解(设未知数x,列出2x加15减5等于110),还有一种是简化的净变化关系式。
基础模型Qwen-7B在64次采样里,10次用了倒推法,其余用了代数法,两条路都活着。经过直接RLVR训练之后的SimpleRL模型,64次采样里倒推法从10次直接变成0次,53次全部挤到了代数法这一条路上,门被彻底焊死了。
但这不是必然的命运。OLMo-3这个模型系列走的是另一条训练路线,先做**监督微调**(SFT,Supervised Fine-Tuning,用人工标注的正确答案直接教模型模仿),再做**直接偏好优化**(DPO,Direct Preference Optimization,让模型学习"哪个答案更好"的相对偏好),最后才上RLVR。这个分阶段的流水线,在同一道饼干题上,SFT阶段倒推法出现1次,DPO阶段出现8次,RLVR阶段出现6次,倒推法的门始终没被焊死,而且最终这个模型在这道题上的准确率也是满分。
这个对比透露了一件挺重要的事:解法收窄不是准确率提升必须付出的代价,它更像是某种训练配方带来的副作用,换一种配方,副作用可以被规避。
研究者还专门做了一组监督微调的对照实验,直接用穷举出来的多种正确解法去训练模型,发现哪怕只给模型学一种解法(k=1),它保留的解法覆盖率(0.471)也超过了RLVR训练后期的模型(0.268)。如果给它学四种、八种解法,覆盖率能一路涨到0.766。这基本上说明,只要你愿意在训练数据里多喂几种解法进去,模型是完全有能力把这些解法都记住并保留下来的,收窄不是模型能力的天花板,而是RLVR这种"只奖励结果、不管过程"的训练方式自身带来的选择压力。
论文对这背后的机制也给出了一个直觉性的解释。RLVR每次更新参数,只根据模型实际采样出来的那些路径打分,如果某条路径在早期偶然表现差一点,它被采样的概率就会稍微降低,而概率一降低,它下次被采样、被进一步验证、被强化的机会也就更少。这是一个自我强化的恶性循环,一开始极其微小的偶然波动,会在成千上万次训练迭代之后被滚雪球式地放大成彻底的路径消失。这不是模型"故意"要抛弃某条路,而是训练机制本身的数学结构决定了强者愈强、弱者愈弱。
如果把这个过程类比成一个班级里的评优机制,一开始几个学生解题方法各不相同,老师随机抽查表扬了几个用某种解法的学生,这几个学生因为被表扬,更愿意继续用这种解法、也更容易被再次抽到表扬,而用别的解法的学生因为没被抽到,慢慢就不敢再用那种冷门解法了,不是他们不会,是他们觉得反正不会被表扬,渐渐地全班就趋同成一种解法。如果老师不这样随机抽查,而是每种解法都保证抽查到,那这种趋同就不会发生这么快。
**写在后面**
这篇论文里最让我意外的一个细节,是那个"零访问家族"的稳定性检验。研究者担心自己说某个入口家族"从没被采样到过"只是运气不好,样本不够,于是又多采样了1024次,拆成两批各512次分别检验,结果337个"消失的家族"里有336个在第二批512次采样里依然一次都没出现。这不是采样噪声,这是真的被锁死了,而且锁得挺死。
另一个让我反复琢磨的地方,是论文里那个关于"访问"和"执行"的**沙普利值分解**(Shapley decomposition,一种源自博弈论、用来公平分配"贡献"的数学方法)。研究者算出来,训练前后模型解题概率的变化里,34.5%可以归因于"入口访问的重新分配",65.5%归因于"给定入口后执行能力的提升"。这意味着执行能力其实是在变好的,只是它的舞台变窄了,好比一个演员演技越来越精湛,但剧团只让他演一个角色。
这让我想到一个更大的问题,不局限于AI训练:任何一个反馈机制,只要它的奖励只盯着"结果对不对",而不关心"过程用了几种方式",它天然就会催生出这种赢家通吃的收窄效应。公司的绩效考核、学校的应试教育、甚至社会媒体的流量分发算法,内核逻辑都很相似。这篇论文用一个数字游戏把这个机制的运作细节,精确到了"每一个词的概率变化"这种颗粒度上,这种精确性本身就挺难得的。
那扇被锁住的门背后,房间其实一直亮着灯,东西也都还摆在原处,只是没人再愿意走进去看一眼了。你说,这算不算是一种很安静的遗忘?
Q&A
Q1:RLVR训练后AI模型解题多样性下降,是因为模型能力变弱了吗?
A:不是。论文发现即便在训练前后都能解出来的题目上,模型依然会丢失大量原本会的解法,而且被"入口提示"唤醒后,这些丢失的解法完成率能恢复到甚至超过早期水平,说明能力还在,只是不再主动选择那条路。
Q2:入口家族具体指什么?
A:入口家族是指在Countdown数字游戏里,按照解题第一步使用的数字和运算符号对所有正确解法进行的分组,比如"用4乘以某数开头"就是一个入口家族,同一家族下还可能分出不同的后续计算路径。
Q3:有没有办法让AI模型重新找回丢失的解题思路?
A:有。论文发现表面性的提示词修改基本无效,但把训练后期模型部分层的参数和训练早期checkpoint的参数做层级混合,或者在测试时强制模型对每个可行入口都尝试一次,都能在不损失准确率的前提下明显恢复解法多样性。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
阿里团队提出DICS方法,通过评估图片、问题、答案三者的内在一致性给训练数据打分,结合自适应采样策略筛选高质量子集。仅用25%的LLaVA-1.5-665K数据训练即超越全量数据效果,并在600万样本规模验证下用不到四分之一数据逼近官方InternVL3-8B性能。