
这项由韩国科学技术院(KAIST)、纽约大学、蒙特利尔大学及Mila魁北克人工智能研究所联合开展的研究,以预印本形式发布于2025年5月,论文编号为arXiv:2605.19376。感兴趣的读者可通过该编号在arXiv平台查阅完整论文。
当你面对一道棘手的数学题,你不会只闭眼猜一个答案然后举手认输。你会先试一条思路,发现走不通,再换另一条,也许还会同时在脑子里并排比较几种可能。这种"走走看、不行换条路"的思维方式,正是人类解决复杂问题的核心能力之一。然而,当我们把目光转向今天的AI推理系统,却会发现一个耐人寻味的尴尬:绝大多数现有的模型,哪怕再聪明、再强大,本质上都是沿着一条固定的轨道一路走到终点,既不会回头,也不知道旁边还有其他的路。
这个问题听起来或许有些抽象,但它的影响却非常具体。当一道问题存在多个正确答案时——比如国际象棋棋盘上有好几种合法的落子方式——一个只会走单一路径的AI就会陷入所谓的"模式坍塌":它每次都给出同一个答案,完全意识不到其他同样有效的解法。来自KAIST等机构的研究团队意识到了这个根本性的局限,并提出了一套名为GRAM(Generative Recursive reAsoning Models,生成式递归推理模型)的新框架,试图给AI的推理过程注入真正的"探索基因"。
**一、推理的两条路:长跑选手与多线并进**
在理解GRAM之前,有必要先了解AI推理领域当前的两大主流方向,以及它们各自面临的困境。
第一条路是以大型语言模型为代表的"序列延伸"方式。简单来说,这些模型通过不断生成一个又一个的词语或推理步骤来"思考",就像一个运动员沿着跑道向前奔跑,每跑一步就是多一个推理环节。这种方式的优势是直观、灵活,但代价是效率较低——每多一步思考,就要额外输出一些文字或符号,计算量随之增加。
第二条路则是"递归推理模型"(Recursive Reasoning Models,简称RRM)的方向,其中包括近年来颇受关注的HRM(层次推理模型)和TRM(递归推理模型)。这些模型不走"往外输出更多词"的路子,而是在内部反复打磨一个隐藏的"思考状态"。可以把它理解为一个雕塑家:不是一刀刀加泥,而是对同一块泥土反复揉捏、修改,每一轮打磨都让作品更接近理想形态。这种方式的妙处在于,模型不需要变得更大、不需要输出更多内容,单靠"反复打磨"就能提升推理深度,计算资源的利用效率因此大幅提高。
然而,这些递归推理模型有一个致命的共同问题:它们的推理过程是完全确定的。也就是说,给同一道题、从同一个起点出发,模型每次都会走出完全一样的路径,得到完全一样的答案。就像一个雕塑家每次面对同样的泥土,都会做出一模一样的动作,最终雕出一模一样的作品——哪怕旁边还有好几种同样精美的创作方式,他永远不会去尝试。这种"单轨道"的局限,使得现有的递归推理模型在面对多解问题时表现欠佳,也让它们很容易陷入某个"局部最优"的死胡同里出不来。
**二、GRAM的核心思想:让推理走出随机性的分叉路口**
GRAM的核心贡献,正是在递归推理的框架里引入了"随机性"——用更通俗的话说,就是让推理过程不再是一条固定的铁轨,而变成一片可以自由探索的旷野。
具体来说,GRAM的运作方式可以用"随机探索地图"来理解。假设你要在一张大地图上找到宝藏,传统的递归推理模型就像一个探险家:每次都从营地出发,沿着同一条小径,经过同样的树林、越过同样的河流,最终找到(或找不到)宝藏。而GRAM则不同:它在每一步前进时,都会根据当前所处的位置,向周围随机"望一望",然后从多个可能的方向中选一个走下去。不同的探险家出发后会走出截然不同的路径,最终有的找到宝藏,有的没找到,但只要同时派出足够多的探险家,找到宝藏的概率就会大幅提升。
在技术层面,这种"随机探索"是通过"可学习的随机引导"(Learnable Stochastic Guidance)实现的。每一步推理中,模型先做一次"确定性更新"——就像探险家根据地图判断大方向;然后在这个方向上叠加一个从特定概率分布中采样的随机扰动——就像探险家在迈步时因为风或地形的影响而稍微偏离了预定方向。这个随机扰动不是纯粹的噪声,而是有方向感的:它的均值(μθ)代表模型认为当前应该往哪里"推一把",方差(σθ?)则代表探索的幅度有多大。
这种设计的精妙之处在于,随机性和方向感是可以同时存在的。纯粹的随机让模型在面对简单问题时依然能找到多样解法;有方向的引导则让模型在面对复杂、结构化的问题时不至于漫无目的地乱走。研究团队通过消融实验(也就是"拆东墙补西墙"式的对比测试)验证了这一点:单独去掉随机性,模型在多解问题上会崩溃;单独去掉方向引导,模型在复杂约束问题上表现下滑;而两者都具备的完整GRAM,则在各类任务上都保持了稳健的表现。
**三、"深度"与"宽度":推理能力的两个缩放维度**
谈到AI的推理能力,一个绕不开的话题是"如何在使用时让模型变得更聪明"——专业上叫做"推理时缩放"(Inference-Time Scaling)。传统递归推理模型只有一个可以调节的旋钮:深度,也就是反复打磨的轮数越多,推理越充分。然而,深度缩放有一个固有缺陷——它是串行的,必须一步接一步地等待,就像流水线上只有一个工人,再努力也有时间上限。
GRAM在保留深度缩放的同时,开创了一个全新的维度:宽度缩放。具体做法是:同时派出N个独立的"随机探险家",每人走出一条不同的推理路径,最终从N个候选答案里选出最好的那个。这种"广撒网"的策略可以与深度缩放并行运作,既不互相干扰,又相互补充。
如何从N个候选答案里选出最好的?研究团队提出了两种策略。第一种是多数投票:哪个答案出现次数最多,就选哪个。第二种更精妙,是用一个叫做"潜在过程奖励模型"(LPRM)的价值评估器,它能根据推理过程中每一步的潜在状态,预测这条路径最终得出正确答案的可能性有多高。如果把N个探险家的过程也录了下来,LPRM就相当于一个经验丰富的分析师,看着每个人走路的姿势和节奏,提前判断谁最有可能找到宝藏。
实验结果非常直观地展示了宽度缩放的威力:在极度困难的数独谜题(Sudoku-Extreme)测试中,GRAM用16轮深度迭代配合20个并行样本(N=20),就超越了确定性基线模型TRM在320轮迭代时的成绩(97.0% vs 90.5%)。换句话说,GRAM用更短的等待时间,通过多路并行的方式,取得了对手穷尽更多步骤也无法达到的效果。这对于实际部署中的延迟问题有着非常现实的意义。
**四、分层结构:大脑的"快慢思维"在模型里的映射**
GRAM不仅在推理策略上有创新,其内部结构也采用了颇具匠心的分层设计,这一设计灵感来自人类认知科学中著名的"快思维与慢思维"理论。
GRAM的潜在推理状态由两个部分组成:高层状态(h)和低层状态(l)。低层状态负责细粒度的、快速的局部运算,每完成一次高层更新,低层需要先进行K次快速迭代,就像大脑中的"快思维"——迅速处理眼前的细节信息,做出即时反应。高层状态则相对缓慢,每完成一轮完整的低层处理后才更新一次,承载更抽象、更宏观的推理方向,类似"慢思维"——深思熟虑,把握全局。
关键的随机性恰好注入在高层状态的更新环节。这是一个经过深思熟虑的选择:让随机性影响的是宏观推理方向(高层状态),而不是具体的计算细节(低层状态)。研究团队也确实尝试过在低层状态引入噪声,但发现对性能没有帮助。这一发现提示,真正有价值的探索发生在"决策的宏观层面",而非"执行的细节层面"——这与人类思维中"战略性的创新来自于大局观的转变,而非小动作的调整"的直觉是一致的。
这种分层结构让GRAM在每一轮递归中完成的计算量远超表面看起来的数字:设外层递归T步,每步内部包含K次低层迭代,总计算量实际上达到T×K步,但被整齐地组织成了一个高效的两级体系。
**五、用概率框架训练模型:变分推断的故事**
GRAM不只是一个新颖的推理架构,它还有一套配套的训练方法,让随机性"有组织地发挥作用",而非变成无意义的噪声。
整个训练过程基于概率论中的"变分推断"(Variational Inference)框架,核心思想是:既然我们无法直接让模型在所有可能的推理路径中找到最优解(路径太多,无法穷举),那就退而求其次,优化一个叫做"证据下界"(ELBO)的替代目标——它是真实目标的一个合理近似,优化它等价于同时做两件事:一方面让模型在给定答案的条件下找到尽可能合理的推理路径(重建能力),另一方面让推理路径的先验分布和后验分布尽量接近(避免走太离谱的弯路)。
训练时,模型会见到完整的输入和正确答案,并通过"变分后验"(Variational Posterior)学习在知道答案的条件下如何规划推理路径。推理时,正确答案未知,模型只依赖"先验"自行探索。这种训练-推理的结构分离,是概率生成模型的标准范式,在语音识别、图像生成等领域均有成熟应用,而GRAM是将其首次系统性地引入递归推理框架的尝试。
为了让训练在计算上可行,GRAM采用了"截断梯度"(Truncated Gradient Propagation)的工程技巧:每个监督步骤内部只从最后一步往回传梯度,而不是从整条路径的起点传到终点。这虽然引入了一定的近似误差,但极大地节省了显存和计算,是长序列模型训练中的标准做法。研究团队通过实验验证,这种近似并不会破坏训练方向:随着训练推进,完整的ELBO目标和代理目标都单调下降,说明近似训练确实在有效优化真实目标。
**六、从解题到创作:GRAM的生成能力**
GRAM还有一个颇为惊喜的能力:当输入端被置为空白(即没有任何条件信息时),GRAM可以从零开始,自主生成结构化的内容。这意味着,它不仅是一个"解题器",也可以是一个"创作器"。
研究团队在两个场景下测试了这种无条件生成能力。第一个场景是让GRAM从空白棋盘出发,自动生成满足所有约束条件的完整数独谜题。结果相当惊人:GRAM用1090万参数、仅16步递归迭代,生成了99.05%有效的数独棋盘(即99.05%的生成结果完全符合所有数独规则),远超用5510万参数、1000步去噪迭代的同类扩散模型D3PM(后者最高仅达到91.33%有效率)。参数量只有对手的五分之一,迭代步数只有对手的六十分之一,生成质量却大幅领先——这种效率对比尤为突出。
第二个场景是在二值化MNIST手写数字数据集上的无条件图像生成。与确定性基线TRM相比,TRM在这个任务上几乎完全失败(FID得分高达303.29,意味着生成图像质量极差,模型陷入了严重的"模式坍塌"),而GRAM生成的图像质量(IS约2.04,FID约73.34)与专为生成任务设计的扩散模型D3PM(FID约74.03)旗鼓相当。更有趣的是,GRAM的生成质量随着递归深度单调提升——哪怕把推理步数增加到训练时所用的16步之外,延伸到256步,质量依然在持续改善。这意味着GRAM的递归精炼能力具有一定的外推性,测试时可以"超出训练范围地思考"。
从推理过程的可视化来看,GRAM的生成不是一步到位的,而是从一片漆黑中逐渐"雕刻"出形状。以手写数字为例,初始状态是全黑图像,随着递归步数增加,模糊的轮廓出现,细节不断补全,最终收敛为清晰的数字。即便中途出现了错误或模糊的形态,后续的递归步骤也有机会将其纠正——这正是"反复精炼"机制的核心价值所在。
**七、实验验证:四个测试舞台,四场不同的角力**
研究团队设计了四类实验场景,每一类都针对GRAM的某个具体优势进行验证。
第一类是高难度谜题任务。数独极端版(Sudoku-Extreme)是一个9×9的数独谜题集合,每道题的已知数字极少,需要大量的约束传播和逻辑推演。在这道"硬核题"上,GRAM以97.0%的准确率大幅领先HRM(55.0%)和TRM(87.4%),甚至超越了671亿参数的Deepseek-R1(后者在这道题上得了0分)。ARC-AGI是另一类以抽象视觉推理见长的测试,包含ARC-AGI-1和ARC-AGI-2两个版本,后者是专为挑战前沿AI设计的升级版。GRAM在ARC-AGI-1上达到52.0%,在ARC-AGI-2上达到11.1%,均超过了确定性递归基线HRM和TRM。值得注意的是,这些数字是在没有任何外部数据增强、没有大规模预训练的条件下取得的,研究团队也坦诚地指出,Grok-4等顶级大模型(66.7% on ARC-1,16.0% on ARC-2)依然领先,这些数字仅作为"难度参考"而非"公平竞争"的基准。
第二类是多解谜题任务。N皇后问题要求在N×N的棋盘上放置N个皇后,使得没有任何两个皇后互相攻击。对于8×8棋盘,有时一道题可以有多达18种不同的合法解法。GRAM在单次采样(N=1)下就达到了99.7%的准确率,远超AR(96.3%)和MDLM(96.1%)等专为生成任务设计的模型。覆盖率(即20次采样中找到了多少种不同的合法解法)方面,GRAM达到了90.3%,也优于所有对比基线。图着色问题(Graph Coloring)同样是个多解问题:给一张图的节点染色,相邻节点不能同色,要用尽量少的颜色。GRAM在这个任务上的"冲突边数"(衡量约束违反程度的指标,越低越好)远低于确定性递归模型,与专业生成模型持平甚至更优。
比较有意思的一个实验结果是:当一道N皇后题的合法解数量从2、3增加到10、15甚至18种时,确定性递归模型的准确率急剧下滑,几乎归零——因为合法解越多,模型陷入"到底该输出哪个"的困境就越深,最终什么都说不出来。而GRAM的表现基本保持平稳,随着解数增多仅有轻微下降,充分体现了随机探索机制的鲁棒性。
第三类是推理时缩放分析。在数独任务上,研究团队系统地测试了不同迭代深度(8步到320步)与不同并行样本数(N=1到50)的组合下,各模型的准确率变化。结果显示,GRAM在两个维度上都能持续受益,而确定性基线只在深度上有改善空间,无法利用并行采样。最引人注目的是前面提到的数据点:GRAM用16步深度配合N=20并行样本,就超越了TRM用320步深度、N=1所能达到的上限。这意味着,当我们有多台服务器可以并行运算时,GRAM的效率优势会被进一步放大。
第四类是消融实验,也就是把GRAM拆开来验证每个设计选择的贡献。研究团队从最基础的Looped Transformer出发,逐步加入深度监督(Deep Supervision,DS)、层次递归(Hierarchical Recursion,HR)和随机引导(Stochastic Guidance,SG),记录每一步的性能变化。结果清晰表明,随机引导(SG)是最具普遍价值的组件:不论底层架构是平坦的Looped Transformer还是层次化的HRM/TRM架构,加入SG都能带来性能提升。这说明随机引导是一个"架构无关"的通用改进,有望被移植到其他递归推理框架中。
另一组消融实验专门拆分了"随机性"和"方向引导"这两个子组件。去掉方向引导(ε~N(0, σθ?I),纯粹随机噪声)时,数独准确率基本持平(94.88% vs 93.96%),但N皇后覆盖率急剧下降(50.27% vs 99.69%)——说明有结构的引导对于多解问题至关重要。去掉随机性(ε=μθ,纯粹确定性引导)时,两个任务上准确率直接归零——因为训练时模型知道答案,确定性地"照着答案走",导致严重过拟合,推理时完全失效。这组实验精准地揭示了两个组件各自不可或缺的角色。
**八、局限与展望:诚实地面对尚未解决的问题**
研究团队在论文中坦诚地指出了GRAM目前面临的主要局限,这种坦诚本身也值得记录。
最显著的挑战是训练效率问题。GRAM依赖深度监督(在每一个监督步骤结束时都计算损失并更新梯度),这意味着整个训练过程必须按照递归步骤的顺序串行进行,无法像标准Transformer那样在batch维度以外大量并行化训练计算。在数独任务上,训练8个GPU需要约2小时;在更复杂的ARC-AGI任务上,则需要约5天。这种训练成本随着任务复杂度迅速攀升,使得GRAM目前难以直接扩展到大规模基础模型的训练范式中。
此外,GRAM在现有实验中的规模(参数量约1000万)远小于当今的大型推理模型(动辄数百亿甚至数千亿参数)。研究团队明确指出,他们的目标是验证"概率多轨迹递归"这一设计原则的有效性,而非与通用大语言模型直接竞争。在这一定位下,实验结果已经充分说明了这一原则在合适的任务范畴内的价值,但从这里到"大规模基础模型"之间,仍有相当的距离需要探索。
从更长远的视角来看,GRAM提出的"宽度缩放"概念,与当前AI领域的一个热门方向不谋而合:通过在推理时增加并行计算,来弥补单一模型深度的局限。这种思路在AlphaGo的蒙特卡洛树搜索、大语言模型的Best-of-N采样中都有不同形式的体现,而GRAM将其与端到端的潜在状态训练和概率生成框架有机结合,提供了一种新的实现路径。随着并行计算硬件的不断进步,这种"广撒网再优中选优"的策略在实际部署中的竞争力有望持续提升。
归根结底,GRAM做的事情说起来朴素:它让AI在思考时不再只走一条路。但这个看似简单的改变,背后蕴含着从概率论到变分推断、从分层动态系统到自适应计算时间的整套工程设计。这套设计让一个1000万参数量的紧凑模型,在某些维度上超越了用更多步骤迭代的确定性对手,也让同一套框架能够无缝兼容推理和生成两种截然不同的应用场景。这至少证明,未来的AI推理系统有理由往"既深且广、既确定又随机"的方向演进,而不只是"越来越大"或"越来越长"。
Q&A
Q1:GRAM与HRM、TRM等递归推理模型相比,最核心的区别是什么?
A:GRAM最核心的区别在于引入了随机性。HRM和TRM每次给定相同输入,都会走出完全一样的推理路径,得出相同答案。GRAM则在每一步推理中叠加一个有方向的随机扰动,使得每次运行都可能走出不同路径,从而能够探索多种解法。这个随机扰动不是纯噪声,而是由神经网络学到的、有倾向性的引导信号,兼顾了探索多样性和推理准确性。
Q2:GRAM的宽度缩放和深度缩放有什么实际区别,哪个更有优势?
A:深度缩放是让模型多迭代几轮,每轮串行完成后才能进行下一轮,等待时间会随迭代数线性增加。宽度缩放是同时跑N条不同的推理路径,每条路径独立并行计算,不增加等待时间,只增加并行计算资源。两者并不互斥,GRAM在实验中表明,16步深度加N=20并行样本,就能超过确定性模型320步深度的结果,说明在计算资源允许时,宽度缩放是非常高效的补充手段。
Q3:GRAM为什么能做无条件生成(比如生成完整数独棋盘),而不只是做条件推理?
A:GRAM在训练时学到的是一套从潜在状态反复精炼最终解码输出的能力。当输入端置为空白时,模型会依赖训练时建立的"先验",自发地从随机初始状态出发,通过多轮递归自主生成符合约束的输出。本质上,这与条件推理用的是同一套机制,只是没有了外部条件的约束,模型的随机探索空间更大,因此能生成多样化的合法结构。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。