
你有没有想过一个问题:当你让一个AI模型反复尝试解一道数学题时,它到底应该"保守"还是"冒险"?
保守一点,它会一遍遍重复同一种解法,哪怕这种解法从来没对过。冒险一点,它可能会尝试稀奇古怪的思路,但大部分时候只是在浪费计算资源。这个矛盾在强化学习训练大语言模型的时候特别明显,业内管这套训练方式叫RLVR
**RLVR(Reinforcement Learning with Verifiable Rewards)**:一种用"可验证奖励"来训练语言模型的强化学习方法,简单说就是让模型做题,答案对不对可以自动判断,对的就奖励,错的就不奖励,模型靠这种反馈不断进步。
这套方法这几年成了训练推理模型的主流路子,DeepSeek-R1这些模型的推理能力很大程度上就是靠它练出来的。但这里面藏着一个一直没被好好解决的痛点:怎么才算"高效探索"?
**核心问题:探索这件事,到底怎么算成功**
想象你在教一个学生做题。他每次都用同一种方法算,算对了皆大欢喜,算错了也不知道换个思路试试。你作为老师,肯定希望他偶尔"跳出框架"想想别的解法,说不定能发现更好的路径。
但问题是,你怎么知道"跳出框架"这件事到底有没有用?
在RLVR的世界里,"跳出框架"对应的操作叫提高采样温度
**采样温度(Temperature)**:控制模型生成文字时"随机程度"的一个参数,温度低,模型倾向于总是选最保守、最常见的词;温度高,模型更愿意尝试不寻常的表达和思路,输出会更多样化,但也更容易出错。
已有的做法基本分成两条路。第一条是硬堆样本量,也就是业内说的test-time scaling
**Test-time scaling**:在推理阶段不改变模型本身,而是多采样几次、多试几条路径,然后从里面挑最好的结果,说白了就是"多算几遍总有一遍是对的"。
多采样确实管用,但它有个绕不开的代价:你要花更多的计算资源。如果预算是固定的,采样越多,每条路径能分到的"关注"就越少。
第二条路是调整解码策略,比如动态调节温度,让模型在训练不同阶段用不同的随机程度采样。这条路省了预算,但留下另一个问题:你调整了温度,模型输出确实更多样了,但这种多样性到底带来了多少实际收益?没人告诉你。换句话说,你知道自己在"探索",但不知道这个探索值不值。
这篇论文的作者们盯上了这个空白。他们提出的方法叫TGRL(Temperature-Grouped Reinforcement Learning,温度分组强化学习),核心想法特别直接:既然温度能控制探索程度,那能不能直接拿温度的差异当作衡量探索价值的尺子,再把这把尺子量出来的价值,精确分配到每一个字(token)上去?
这就是整篇论文要讲的故事。
**用"保守参照组"和"冒险探索组"量出探索到底值不值**
TGRL做的第一件事,是把每次采样分成两拨人马。
对同一道题,模型先用一个较低的温度(论文里设为0.3)生成几条保守的回答,这拨叫低温参照组。再用一个较高的温度(默认1.2)生成另外几条更"敢想"的回答,这拨叫高温探索组。
这个设计乍一看很朴素,但背后有个精巧的数学考量。论文里证明了一件事:把这两组的平均奖励做差,也就是高温组的平均得分减去低温组的平均得分,这个差值是"探索收益"的无偏估计。
换句话说,这个差值直接告诉你:对这道题而言,让模型更敢想,到底是帮了倒忙还是真的有用。
如果差值是正的,说明高温探索确实带来了额外的正确率,值得鼓励;如果是负的,说明保守才是对的,模型没必要瞎折腾。这一步的关键在于,它是按每道题单独算的,不是笼统地说"整体上探索有没有用",而是精确到"这道题上探索有没有用"。
这里可以打个比方。你带着一个刚学做菜的朋友进厨房,让他做十道菜。如果你只在最后看总体评分,说这十道菜整体做得还行,那你根本不知道哪道菜是靠按部就班的老办法做好的,哪道菜是靠他临时加了一把孜然才救回来的。但如果你每道菜都留一份"标准做法"的对照,再留一份"他自由发挥"的版本,两两一比,你立刻就知道哪道菜适合让他随便发挥,哪道菜他还是老老实实照着菜谱来比较稳妥。如果不做这个对照,你要么让他每道菜都循规蹈矩(错过所有能靠创意翻身的机会),要么让他每道菜都放飞自我(把本来能做好的菜也搞砸)。TGRL的分组机制,本质上就是给每道题都配了这样一份"对照菜谱"。
论文里管普通的、不分温度的分组方式叫单温度组归一化,这种做法有个先天缺陷:同一个组里的样本全都来自同一个温度,组内根本没有"温度对比"这回事,所以压根没法回答"提高温度到底有没有用"这个问题。TGRL通过引入低高温两个子组,才第一次把这个隐藏的量给显式地算出来了。
这个探索收益差值算出来之后,并不是简单地加到原来的奖励上完事。论文进一步证明,如果把两组样本混在一起做统一的组内归一化(也就是常见的GRPO式优势计算),高温组每个样本的优势值会自动被一个正比于探索收益的项整体平移,低温组则会被反向平移。
**GRPO(Group Relative Policy Optimization,组相对策略优化)**:一种流行的强化学习训练方法,做法是把同一个问题的多次采样结果放在一起比较,谁的奖励比组内平均水平高,谁就获得正的"优势值",然后用这个优势值指导模型往这个方向调整,DeepSeekMath等工作把它确立为RLVR的标准套路之一。
这就是这套机制精妙的地方:不需要额外设计复杂的奖励整形规则,仅仅是把两个温度的组混在一起统一归一化,探索收益就自然而然地渗透进了每个高温样本的更新信号里。
**JS散度:把"探索值不值"精确定位到哪个字**
算出了"这道题该不该探索",接下来的问题是:如果该探索,探索的功劳应该记在哪个字头上?
这才是TGRL整套设计里最有意思的部分。因为一条回答动辄几百上千个字,如果笼统地说"这条回答整体上探索得不错",然后把奖励信号平均分摊到每一个字上,那和没有信息量的做法其实差不多,力度是被稀释掉的。
论文的思路是:既然低温和高温的差别本质上是同一份"逻辑"(也就是模型算出来的logits)经过不同的温度缩放得到两种不同的概率分布,那我可以直接去看,在每一个字的位置上,这两个概率分布差异有多大。差异越大,说明这个位置对温度的变化越敏感,也就越应该被认为是"探索真正发生的地方"。
衡量两个概率分布差异,论文用的是JS散度
**JS散度(Jensen-Shannon Divergence)**:一种衡量两个概率分布之间差异程度的数学工具,特点是对称(不管你从哪个分布看向另一个都一样)且有上下界(不会无限大),常被用来比较两组数据分布是不是"长得像"。
具体做法是,对高温组里的每一条回答,重新过一遍模型,拿到每个位置的原始logits,然后分别用低温和高温去做softmax,得到两个概率分布,再算这两个分布的JS散度。散度越大,说明在这个位置上,如果切换温度,模型接下来会说的字很可能发生剧烈变化,这正是探索性最强的位置。
论文里有一条理论证明特别关键:JS散度的平方根,给出了"切换温度对后续预期收益能造成多大改变"的一个上限。换句话说,你在某个位置观察到的JS散度越大,这个位置对最终结果的潜在影响力就越有保证。基于这条数学关系,论文进一步证明,任何按JS散度单调递增设计的权重分配方式,分给"高影响力位置"的信用份额,一定不会少于平均分配的份额。
这套推理听起来抽象,换个场景就好理解了。想象你在给一篇作文改错,老师告诉你这篇作文整体上"有创意但也有风险"。如果你不知道具体是哪句话体现了创意、哪句话是风险,你只能把这句评语泛泛地贴在作文最后。但如果你能标出每一句话在"平淡写法"和"大胆写法"之间的分歧程度,你立刻就知道该重点表扬或者重点修改的是哪几句话,而不是整篇文章一视同仁地打个笼统的分。如果不这样区分,你等于是把一句真正精彩的转折句和一句无关紧要的过渡句给了同样的关注度,真正值得强化的地方反而被稀释掉了。
论文还做了一个很扎实的验证实验,叫局部冷却探测
局部冷却探测(Local-cooling Probe):论文设计的一个诊断实验,做法是从模型成功的高温探索路径中挑一段文字,人为把这段文字换成低温偏好的词,然后看模型接下来还能不能把题做对,如果换了之后经常做错,说明这段文字原本确实是"温度敏感"、真正起到探索作用的地方。
实验结果显示,用JS散度挑出来的文字段,被"冷却"后的翻车率达到12.1%,得分平均下降0.241,明显高于用熵、用置信度差距等其他方式挑出来的文字段。这说明JS散度确实找到了信息量更大的位置,而不是随便找了个看起来"不确定"的地方。
有意思的是,论文里对低温组做了一个近乎苛刻的设计:低温组虽然参与计算整体的奖励统计(也就是均值和方差),但它本身完全不获得任何梯度更新。换句话说,低温组的作用仅仅是当一把"尺子",用来衡量高温组探索得值不值,它自己不会因为这次训练发生任何改变。
论文里专门论证了这个设计的必要性:如果反过来,让低温组和高温组都参与更新,探索收益信号就会同时以正负两个方向出现在两组样本里,互相抵消、互相干扰,反而削弱了原本干净的探索信号。这就好比你要评估一个新员工的创新方案好不好,你请了一位经验丰富的老员工做对照参考,但你完全没必要因为对照参考"表现平平"就去批评或者奖励这位老员工,他的角色只是提供一个基准,不是被评判的对象。
**把训练效率和准确率都摆到台面上**
说了这么多机制设计,最终还是要看效果。论文在数学推理、代码生成、长程智能体任务三大类共11个基准上做了系统评测。
数学推理这块,模型用的是Qwen3系列,覆盖14B和32B两个规模,训练数据来自DeepScaleR。评测覆盖AIME 2024/2025、AMC 2023这类竞赛级题目,MATH500这种跨难度综合题库,还有Minerva和Olympiad两个更偏STEM和奥赛风格的基准。
结果显示,TGRL在14B和32B两个规模上都拿到了六个基准的最高平均分,分别是69.4%和70.2%,比表现最好的基线方法高出1.4到1.6个百分点。竞赛类题目上的提升尤其明显:14B规模下,AIME24提升2.2个百分点,AIME25提升1.5个百分点,Olympiad提升1.6个百分点;到了32B规模,TGRL在全部六个基准上都是最优,Olympiad的领先幅度扩大到4.2个百分点。
因为AIME这类竞赛题库每套只有30道题,样本量小容易导致评测结果波动,论文额外做了五个随机种子的重复实验。结果显示种子间的波动幅度普遍不大,TGRL相对GRPO的平均领先幅度基本都超过了单次实验内部的标准差,说明这个提升不是巧合。
代码生成这边用的是Qwen3-4B,训练数据是DeepCoder,测试覆盖LiveCodeBench、CodeForces和HumanEval+三个基准。TGRL在LiveCodeBench上的Pass@16达到62.1%,比之前最好的方法高出4.4个百分点。CodeForces评分方面提升更夸张,从基线的1377.6分一路涨到1574.3分,涨了196.7分,对应的百分位排名从71.9%跳到了84.3%。
长程智能体任务方面,测试是在Qwen2.5-7B-Instruct上做的,环境是ALFWorld(家居多步任务)和WebShop(网购决策任务)。TGRL在ALFWorld上的整体成功率达到86.7%,比最强的RL基线高6.3个百分点,其中一个叫Pick2的子任务(需要提前想好多步计划再执行)提升尤其大,从PPO的68.8%直接跳到95.0%。WebShop上,TGRL的成功率提升4.9个百分点,任务得分也有提升。
这些数字背后有一条共同线索:TGRL的优势总是在最需要探索的场景里体现得最明显,竞赛级难题、还没被刷分刷烂的代码基准、奖励稀疏的多步决策任务。反倒是在已经接近满分的基准(比如HumanEval+),各家方法都差不多,因为这些题目本来就不需要太多探索,低温解码已经够用了。这恰好印证了TGRL的设计初衷:它不是无差别地鼓励冒险,而是精准识别"哪里值得冒险"。
**效率也是硬指标:省下来的时间去哪儿了**
光看准确率还不够,训练效率同样重要,毕竟没人愿意为了一点点提升多花好几倍的计算时间。
论文专门做了墙钟时间的对比实验,也就是实打实地测量训练花了多长时间。结果显示,在同样12小时的训练预算内,TGRL达到的AIME综合得分是1.0833,而GRPO只有1.0354,差距是0.048。跟另一个强基线DAPO比,TGRL用6.4小时就达到了DAPO需要10小时才能达到的准确率水平,也就是说省下了大约36%的训练时间。
这个结果其实不算特别令人意外,回头看看前面的机制设计就明白了。TGRL并没有增加采样数量,每道题依然只用4条回答(1条低温+3条高温),额外的计算开销仅仅来自对高温组做一次JS散度的计算,这部分开销和整个Transformer的前向反向传播比起来,量级要小得多。换句话说,TGRL没有多花钱,但每一分钱花得更精准了。这就好比两个人预算一样去买菜,一个人漫无目的地把预算平均分给购物车里所有商品,另一个人先摸清楚哪几样食材对今晚这道菜最关键,把预算集中砸在那几样上,同样的钱,后者做出来的菜显然更好吃。
论文还做了细致的训练动态分析,监控了梯度范数、策略KL散度、响应长度、截断比例等一系列指标。数据显示,TGRL在训练后期(121到150步)达到了最大的梯度范数(0.331)和策略KL(0.160),但PPO裁剪比例始终低于0.11%。这个组合说明TGRL做出了更大幅度但更有针对性的策略更新,而不是到处小修小补。响应长度上,TGRL训练到后期平均只需要2476个字,明显短于GRPO在低温(3915字)和高温(3482字)下的表现,截断比例也降到了7.2%,远低于16.0%和12.4%。这说明模型学会了用更简洁、更聚焦的方式给出正确答案,而不是靠冗长的试错去凑对结果。
**消融实验:拆开来看每个部件到底贡献了多少**
一个方法有效,不代表方法里的每个部件都有用,得拆开来一个个验证。
论文做的第一组对照是纯粹提高采样温度会不会有用。结果显示,单纯把温度从低调到高(也就是GRPO在高温T1下训练,相比在低温T0下训练),14B规模下平均准确率只提升了0.5个百分点,32B规模下提升1.1个百分点,都相当有限。这说明单纯让模型"更敢想"并不足以带来显著提升,光有随机性是不够的。
第二组对照是加入混合温度分组机制之后会怎样。把单一温度的GRPO换成TGRL的分组归一化设计,但暂时不引入JS散度做token级别的权重分配(论文管这个中间版本叫"统一token信用"),14B规模下平均分从67.0%涨到68.2%,32B规模下从66.2%涨到67.8%。这一步验证了:光是把探索收益量化出来、注入到优势计算里,就已经带来了实实在在的提升。
第三组对照是再叠加JS散度的token级信用分配。完整版TGRL相比只有分组机制的中间版本,14B规模平均分从68.2%进一步涨到69.4%,32B规模从67.8%涨到70.2%,其中AIME25这个基准上的额外提升尤其明显(14B上多涨2.5个百分点,32B上多涨3.5个百分点)。
这三组对照拼起来讲了一个清晰的故事:光靠提高温度效果有限,加入分组机制才第一次真正把探索收益量化出来,而JS散度的信用分配则进一步把这份收益精准投放到了该投放的地方。三个环节缺一不可,少了任何一环,效果都会打折扣。
论文里还专门探究了探索温度T1本身该怎么选。实验显示,只要低温和高温之间的差距足够大(T1在1.0到1.6之间都表现不错),效果就相对稳健;只有当差距太小(比如T1=0.8)时,效果才会明显下滑。在这个稳健区间里,T1=1.2 综合来看表现最均衡,既能较早达到较好的验证效果,优化过程也更平稳。这也解释了为什么论文最终把T1=1.2定为默认设置。
低温组和高温组的样本配比同样被拿出来做了敏感性测试。默认设置是1份低温加3份高温(总共4条回答),论文还试了2份对2份、3份对1份的配比。结果显示默认的1比3配比效果最好,平均分比2比2配比高出2.3个百分点,比3比1配比高出1.3个百分点。这说明在固定总预算下,给高温探索组留出足够多的样本比多留几个低温参照样本更重要,毕竟真正承担梯度更新任务的就是高温组,参照组只要够用就行,不需要太厚重。
**写在后面**
读完这篇论文,有一个细节让我反复琢磨:低温组不参与梯度更新这个设计,看起来简单,不就是"不更新"三个字吗,但它背后其实是在回答一个更根本的问题:当你需要一个"基准"来衡量某件事有没有价值时,这个基准本身要不要因为这次衡量而被改变?
这个问题其实超出了机器学习的范畴。你在评判一件事情做得好不好的时候,用来做参照的那把尺子,是不是也应该保持相对稳定,不要被评判过程本身污染?论文用严谨的数学推导论证了如果让参照组也跟着更新,会引入一个方向相反的干扰项,削弱本来干净的信号。这个论证过程挺有启发的,它提醒我们,衡量标准的纯粹性,有时候比衡量对象本身更重要。
另一个让我觉得有意思的地方是,这篇论文没有满足于"效果好"就收工,而是花了大量篇幅去做局部冷却探测这类诊断性实验,专门去验证JS散度找出来的位置是不是真的对结果有影响,而不只是数字好看。这种把"为什么有效"和"是不是真的有效"分开验证的态度,在很多论文里其实是被省略的。
论文最后也留了一个开放的口子,提到未来可以往自适应的多温度分组、更丰富的token信用分配标准这些方向延伸。这让我忍不住想,如果不只是两个温度做对比,而是同时用三四个不同温度采样,会不会能画出一条更细腻的"探索收益曲线",告诉模型在不同难度的题目上,到底该往多"敢想"的方向走多远?这个问题,论文没有回答,但它埋下的这颗种子,确实值得有人接着种下去。
Q&A
Q1:TGRL是什么?
A:TGRL全称Temperature-Grouped Reinforcement Learning,是一种强化学习训练方法,通过对同一道题用低温和高温两种设置分别采样,量化探索行为带来的收益,再用JS散度把这份收益精确分配到每个字的更新信号上,从而更高效地训练大语言模型的推理能力。
Q2:TGRL相比传统方法能提升多少效果?
A:在数学推理上,TGRL在Qwen3-32B上六个基准平均准确率达到70.2%,比强基线高1.6个百分点;代码生成上CodeForces评分提升196.7分;智能体任务上ALFWorld成功率提升6.3个百分点,WebShop提升4.9个百分点,同时训练时间比同类方法节省约36%。
Q3:TGRL为什么要把低温组排除在梯度更新之外?
A:因为低温组的作用是提供一个稳定的参照基准,用来衡量高温探索组带来的收益有多大。如果让低温组也参与更新,探索收益信号会同时以正负两个方向出现在两组样本中,相互抵消干扰,反而削弱了原本清晰的探索信号,所以论文特意设计让低温组只参与统计计算,不接受梯度更新。
好文章,需要你的鼓励
本文介绍LT-OPD训练框架,通过让极限压缩的多模态大模型在自己生成的内容上接受满血版模型指导,并配合渐进式课程学习,在仅保留5%视觉token时把性能保留率从68.6%提升到82.3%,且不增加推理成本。
本文解读ALIGNOPSD方法,该方法针对AI智能体训练中"决策与时间戳错配"问题,通过先对齐功能相同的决策场景再打分,并按可变长度决策段分配信用,在ALFWorld、WebShop、Search-QA三大任务上相比GRPO提升5.5%至8.7%。
本文介绍自适应一致性图(ACG)方法,通过持久化执行记忆图与预算感知的上下文构建,帮助AI智能体在长任务中减少信息失联,在多项基准测试中相比ReAct等基线方法提升了任务成功率。
多智能体AI协作时重复计算KV缓存浪费严重。PReCache提出预计算低秩缓存和中性基础缓存重构两项设计,免训练实现最高3.1倍加速、2.3倍吞吐提升,且准确率仅比不共享方案低1.1个百分点。