微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 中国科学院自动化研究所揭秘:AI智能体如何从"记动作"到"理解世界"——多轮长程规划能力的完整训练物理学

中国科学院自动化研究所揭秘:AI智能体如何从"记动作"到"理解世界"——多轮长程规划能力的完整训练物理学

2026-08-05 16:57
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-08-05 16:57 科技行者

这项研究来自中国科学院自动化研究所认知与决策智能重点实验室及中国科学院大学人工智能学院,论文以预印本形式于2026年7月27日发布在arXiv平台,编号为arXiv:2607.24720v1。有兴趣深入了解的读者可以通过该编号在arXiv上查阅完整论文。

假设你是一位厨师学徒,刚开始学厨时,师傅给你一张食谱(短步骤食谱),你照着做能做出简单菜肴。但有一天,师傅要你独立完成一桌十几道菜的宴席——从采购食材、掌控火候时机、协调每道菜的出餐顺序,到最后摆盘上桌——这就完全是另一码事了。你不仅要记住每道菜的做法,还要在脑子里维持一张整体规划图,随时根据当前情况调整接下来的步骤。

当前的AI智能体面临的正是这个困境。它们在简短任务上表现不错,但一旦任务变长、步骤变多,就会频频出错甚至彻底迷失。这背后的核心挑战被研究人员称为"多轮长程规划"——AI需要在连续多次与环境交互中,始终保持清晰的目标意识和合理的行动计划。

来自中国科学院的研究团队决定系统性地回答一个困扰整个领域的核心问题:AI的长程规划能力究竟是怎么来的?在训练的不同阶段又是如何变化的?这个问题的难点在于,现有的大语言模型都是在互联网上海量的不透明数据上训练出来的,根本搞不清楚某项能力到底是什么时候、怎么被学会的。于是研究团队另辟蹊径,构建了一套完全受控的实验环境,像做物理实验一样精确地研究这个问题——这也正是论文标题中"物理学"一词的来由。

研究团队把整个训练过程分成三个阶段来研究:预训练阶段(相当于厨师学徒打基础的学习期)、基于强化学习的后训练阶段(相当于参加烹饪比赛磨练技艺)、以及多教师模型融合阶段(相当于同时向多位大厨拜师学艺并融会贯通)。每个阶段都有各自关键的发现,合在一起构成了一幅关于AI长程规划能力的完整图景。

一、研究的实验舞台:一个专门设计的"配方炼制"世界

要理解这项研究做了什么,得先认识研究团队搭建的这个特殊实验环境。他们没有使用现成的AI模型和真实世界数据,而是从零开始构建了一个完全可控的"合成宇宙"。

这个宇宙包含三个不同的虚构领域:奇幻炼金术、畜牧农场和电子组装。每个领域里都有一套"物品合成规则",就像游戏里的合成系统——用草种和水可以种出草,草和小羊可以变成羊毛,羊毛和纺锤可以织成毛线,最终才能做出毛衣。整个合成网络有五个层级,每层有40个物品类别,每类有20种具体实例,总共形成了一个复杂的多层树状结构。

任务的设计也非常精妙。AI智能体每次会收到一个目标物品(比如"我想要一件毛衣")和一堆初始材料(包括有用的和没用的"干扰项"),然后需要在有限步数内通过一系列合成操作完成目标。任务难度分三档:短程(1-5步)、中程(6-8步)和长程(9步以上)。关键在于,合成规则不会直接告诉AI,AI必须通过与环境互动来学习和推断这些规则——这才是真正考验长程规划能力的地方。

研究团队在这个环境里精确控制了数据格式、数据分布、数据质量和规划模式,就像在实验室里控制变量一样。他们从头训练了一个基于Qwen2.5架构的1亿参数模型,避免了大型预训练模型中"预先埋藏了什么能力"这一无法排查的干扰因素。评估指标使用的是avg@8(独立运行8次的平均成功率)和pass@8(8次中至少有一次成功的比例),每个测试子集包含160个实例,确保评估的可靠性。

二、预训练阶段的第一课:AI到底在学"背动作"还是"懂世界"?

第一个核心问题是:AI在预训练阶段应该以什么方式学习规划?

研究团队对比了两种截然不同的训练方式。第一种叫"直接预测动作"——AI看到当前状态后直接输出下一步操作,不做任何中间推理,像是一个只记住了"食谱步骤"的厨师,凭肌肉记忆做菜。第二种叫"世界模型内化"——AI在输出动作之前,会先在内心构建一个关于当前环境状态的推理链,预测每个动作会带来什么变化,像是一个真正理解了"烹饪原理"的厨师,能在脑子里模拟每一步操作的后果。

具体来说,世界模型方式要求AI在回答之前,用类似"目标是合成星级药水,合成规则是红宝石矩阵加独角兽矩阵,但两者都不在当前库存里……因此需要先合成红宝石矩阵,红宝石矩阵需要仙女凝胶和石英溶液……"这样的推理链条,层层展开直到找到当前库存中确实存在的材料,然后才给出具体操作指令。

结果非常明确:世界模型方式在短程任务上的平均成功率(avg@8)达到98.9%,而直接预测方式只有89.5%,提升约9.4个百分点。这个差距在中程任务上扩大到39.3个百分点,在长程任务上更是高达45.8个百分点。换句话说,两种方式在简单任务上差别不大,但任务一变长,差距就像雪球一样越滚越大。

不过事情并非一边倒。研究团队观察训练曲线后发现,直接预测方式的确学得更快——在训练的早期阶段,它的表现上升速度更快,需要的训练步数更少,输出的文字也更短,消耗的计算资源更少。这是因为直接预测本质上是在学"背答案",而世界模型则是在学"理解规律"。背答案快但上限低,理解规律慢但最终能举一反三。

这个发现背后有一个深刻的道理:AI要真正具备长程规划能力,不能只会背动作序列,而需要在内心建立一个关于环境如何运转的模型。这个内心的"世界模型"让AI能够模拟未来几步的后果,从而做出更好的当下决策。

三、预训练阶段的第二课:只学简单步骤,能拼出复杂任务吗?

第二个问题更加根本:如果AI只见过简单的单步操作,它能自己"拼"出复杂的长程规划吗?

这个问题在认知科学里叫"组合泛化"——掌握了A技能和B技能,能不能自动学会AB技能的组合?研究团队设计了一系列实验,把训练数据按难度分成三档(短程、中程、长程),然后测试只用短程数据训练的AI面对中程和长程任务时的表现。

答案让人印象深刻:完全指望原子级别的技能自动组合是行不通的。当AI只在短程任务(1-5步)上训练时,它在短程测试中pass@8可以达到93.12%,但面对中程任务时只有0.83%,面对长程任务时直接归零。这说明AI确实学会了各个单独的合成步骤,但它无法自发地把这些步骤串联起来完成更长的任务链。

然而,只需要极少量的长程数据,就能打开这扇门。仅仅加入5%的中程轨迹,中程任务的pass@8就从0.83%猛然跳升至51.88%——提升了63倍!同样,加入5%的长程轨迹,长程任务的pass@8从0提升到11.46%。这种"拨云见日"式的突然提升表明,AI其实已经具备了长程规划所需的基础知识,缺的只是"如何把这些知识串联起来"的示范。就像一个学过了所有乐器基础知识的学生,只需要看几次乐团排练,就能明白各个乐器该如何协同演奏。

这一发现对于实际的AI训练有重要指导意义:在以短程数据为主的训练集中,有意识地加入少量长程演示数据,就能显著激活模型的长程规划能力,而不需要大量昂贵的长程数据。

四、预训练阶段的第三课:训练数据里混进了"坏示范",后果很严重

第三个问题关乎数据质量:如果训练数据里混进了一些错误的、次优的操作示范,会怎样?

在现实世界中,收集到的数据不可能都是完美示范。研究团队模拟了这种情况,把"最优轨迹"和"次优轨迹"按不同比例混合。次优轨迹的特点是:推理过程可能写得头头是道,但实际采取的动作却是错误的(比如随机拿了两个材料往一起合,没有什么道理)。

实验结果触目惊心。当训练数据包含4份最优轨迹和8份次优轨迹时,短程任务的表现从100%跌落到73%,中程任务更是从接近90%直接崩塌到不足1%,长程任务则彻底归零。不仅如此,就算拼命增加采样次数(也就是让AI多试几次),对于中程和长程任务的成功率也几乎没有改善。

这个结果揭示了长程序列决策中一个严酷的规律:错误会累积和放大。在短程任务里,走错一步还有机会纠正;但在长程任务里,早期的一个错误决策就像骨牌一样,引发后续一连串错误,把整个规划彻底带偏。这与人类经验相通——学厨时如果反复被教导用错了某种切法,这个坏习惯在简单菜肴里影响还不大,但做复杂大菜时就会在关键节点上造成不可挽回的失误。

研究团队同时发现,多样化的"最优"规划模式(比如同样是完成任务,但思维推理的格式写法不同)并不会互相干扰——4种不同格式的最优轨迹和1种最优轨迹相比,效果几乎一样好。所以问题的关键不在于"格式是否统一",而在于"决策是否正确"。

五、后训练阶段:强化学习能帮AI"更上一层楼"吗?

在打好预训练基础之后,研究团队转向了第二阶段:用强化学习(RL)来进一步提升规划能力。这就像厨师学徒在学完基础知识之后,通过参加烹饪比赛来进一步磨砺技艺——比赛会给出明确的成败反馈,帮助选手找到最优策略。

研究团队引入了两种核心概念的区分,这个区分非常关键:规划模式(Planning Pattern)和规划知识(Planning Knowledge)。规划模式是指通用的、跨任务可复用的思维框架,类似于厨师学会了"先检查食材再开始烹饪"这个通用习惯,不管做哪道菜都适用。规划知识则是任务特定的具体程序性知识,类似于做红烧肉必须先焯水再下锅这样的具体菜谱,换了另一道菜就用不上了。

用信息论的视角来理解:规划模式与具体任务的关联度较低(互信息低),不同任务共享相同的规划模式;规划知识与具体任务的关联度非常高(互信息高),每个任务需要的知识各不相同。这个区别决定了强化学习能做什么、不能做什么。

六、后训练阶段:强化学习的"有效区域"与边界

研究团队把强化学习的适用范围划分成三个区域,就像地图上的不同地形一样。

第一个区域叫"不必要区域":当预训练数据质量很高(接近全部最优轨迹),且任务的规划步骤较短时,不同规划模式的表现本来就差不多好,强化学习无法带来明显提升——这就像已经考了满分,再怎么刷题也没意义。第二个区域叫"有效区域":当预训练数据质量中等(混有一部分次优轨迹),且任务步骤适中时,强化学习能够有效地从混乱的预训练数据中"淘金",找出并强化那些期望回报更高的规划模式——这才是强化学习真正发挥价值的地方。第三个区域叫"不支持区域":当预训练数据质量很差且任务步骤非常长时,强化学习自身也力不从心了。

研究团队比较了两种主流的后训练算法:GRPO(一种基于最终结果奖励的强化学习方法,类似于只根据菜肴最终是否好吃来给厨师评分)和OPD(在线策略蒸馏,一种让学生实时模仿优秀教师的方法,类似于让学生的每一个切菜动作都在教师的指导下完成)。

在有效区域里,OPD比GRPO有更宽的适用边界。特别是当预训练数据质量差、任务步骤长时,OPD仍然能带来显著提升,而GRPO却往往失效。原因在于:GRPO使用的是稀疏奖励——只在任务最终成功或失败时才给出反馈,这就像厨师做了一桌子菜,只告诉他"整体好吃"或"整体难吃",却不说具体哪道菜有问题。在长程任务里,一个长序列中的正确动作和错误动作全都混在一起,这种粗糙的奖励信号很容易把好的动作和坏的动作都给强化了或都给惩罚了,产生混乱的梯度更新方向。OPD则不同,它在每一个生成的词(token)上都提供实时的模仿信号,就像教师在厨师每一个操作环节都给出指导,信号更密集、更精准。

研究团队通过一种叫"奇异值分解方向分析"的技术手段,直观地证明了这一点:他们追踪了模型参数在训练过程中的更新方向,发现在短程高质量设置下,GRPO的梯度方向相对一致;但随着任务变长、数据质量下降,GRPO的梯度方向越来越混乱,甚至出现梯度消失(即几乎没有更新,模型停滞不前)的情况。OPD的梯度方向则始终保持较高的一致性,说明每次更新都在朝着正确方向努力。

然而,OPD也有自己的局限:它倾向于让模型直接复制教师的规划模式,这减少了模型输出的多样性("熵"降低了),从而压低了pass@k随k增大时的改善空间。GRPO在有效区域内虽然提升幅度和OPD相近,但它保留了更多多样性,在多次采样时表现出更高的"上限"——换句话说,GRPO更有机会偶然走出一条非常好的路,而OPD则让模型老老实实地跟着教师走,不太会走出意外之喜的路线。

七、后训练阶段:规划知识的蒸馏为什么会失败?

接下来是一个非常微妙但极其重要的发现:并不是所有东西都适合用OPD来传授。

研究团队设计了一个实验:同一个目标物品(比如"羊毛"),存在两条完全不同的合成路径——路径A是用水、草种和小羊来合成,路径B是用水、棉籽和纺纱机来合成。研究团队分别训练了掌握路径A的教师A和掌握路径B的教师B,然后尝试用教师B来训练一个预先学了路径A的学生模型(学生A)。教师B本身的表现完美——在所有任务上成功率高达100%。按照直觉,这么优秀的教师应该能把学生教得很好。

然而实验结果相当令人意外:用教师B指导的学生A,其在中等难度任务上的avg@8从教师A指导时的42.19%骤降至6.09%,pass@8更是从51.25%暴跌至7.50%。不仅没有提升,反而比原来更差了,甚至比根本没经过后训练的基础模型还要差!

这种失败的根本原因在于规划知识所具有的"高互信息"特性。由于学生模型在预训练中已经把路径A的合成规则深深编码进了参数里,它的世界模型是围绕路径A建立的。当教师B按照路径B给出指导时,在学生A看来,教师B的很多正确步骤在它自己的世界模型框架内是"错误的"——因为路径不同,步骤之间的逻辑关系就不同。OPD会把教师的指导信号当作学习目标,强行把学生往路径B的方向拉,结果破坏了学生原有的路径A知识,却又没能完整建立起路径B的知识,导致模型陷入一种"两头不靠岸"的中间态。

研究团队用KL散度(衡量两个概率分布之间差异的指标)的动态变化来解释了这个过程:在训练早期,OPD成功地让学生模仿了教师的通用规划模式(思维框架的排列方式),所以初期性能有所提升;但在训练后期,优化目标转向了对具体规划知识的模仿,而学生和教师在知识层面上存在巨大鸿沟,强化学习的更新幅度太小,根本不足以完整替换掉旧知识并建立新知识,最终训练崩溃。这就像一位熟练掌握了法式烹饪的厨师,突然被强制要求只用中式烹饪思维来理解法式食谱——他原有的法式知识被干扰了,但中式知识又没来得及建立,结果两者都用不好。

研究团队还指出,现有训练数据中几乎不包含"从错误中恢复"的纠错示范,但这类数据至关重要。现实中AI难免会走入错误状态,仅靠完美的黄金轨迹是无法让模型学会在犯错后如何重新找回正确方向的。

八、多教师融合阶段:向多位大师同时学习的艺术

研究的第三个阶段聚焦于一个现实场景:如何让一个AI模型同时从多个不同领域的专家教师那里学习,获得多方面的综合能力?这在现实的AI开发中已经是标准操作——包括GLM-5、DeepSeek-V4等顶级模型都采用了类似的多教师融合策略。

研究团队把多教师融合(MOPD,Multi-Teacher On-Policy Distillation)分成三种典型情景,用"模式兼容性"和"模式共享性"两个维度来刻画它们之间的关系。

第一种情景:不同领域的教师虽然各自只精通自己的领域,但它们的规划模式(思维框架)是兼容的,且在底层存在共同的结构。实验结果表明,这种情况下MOPD能实现真正的"跨领域泛化"——仅仅从奇幻炼金术领域的教师那里学习,学生在畜牧农场领域的表现也会随之大幅提升。具体数据上,以4:4次优比例预训练的学生为例,仅接受炼金术教师蒸馏后,畜牧农场领域的中等难度avg@8就从34.92%跳升至52.58%,尽管教师本人对畜牧农场的任务一无所知(成功率0%)。

研究团队通过追踪不同规划模式在各领域的分布比例,揭示了MOPD的核心机制:它不是试图"覆盖"所有教师的所有模式,而是在多个教师之间找到共同认可的规划模式,然后强化收敛到这个共享分布上。这种现象在信息论中被称为"mode seeking"(模式寻找),而非"mode covering"(模式覆盖)——当多个教师都喜欢用"T1目标驱动"这种思维框架时,学生最终会以极高的概率(接近100%)采用这种框架,完全抛弃其他框架,而不是试图在所有教师偏好的框架之间保持平衡。

第二种情景:当不同领域的规划模式部分兼容、部分冲突时,MOPD可以支持"持续学习"——学生在学会新领域的同时,大致保留了对旧领域的能力。研究团队观察到,只要不同领域之间存在某个公共的"避风港"规划模式,模型就能把对这个公共模式的依赖作为避免遗忘的锚点,在新旧知识之间取得相对平衡。

第三种情景则要危险得多:当不同领域之间既不共享规划模式、模式之间又完全冲突时,灾难性遗忘就会发生。具体表现是:模型在学完最新领域(电子组装)之后,最初学习的畜牧农场领域的性能从90%骤降至15.62%。原因是,在没有公共模式作为"缓冲区"的情况下,学生会对最新教师的偏好过度拟合,把那个领域的"捷径"规划模式(实际上含有大量错误)当成普适策略应用到所有领域,从而触发各领域中该模式对应的"陷阱"。

研究团队还通过参数动态分析证明了MOPD的一个重要特性:MOPD对模型参数的改变幅度非常小——MOPD训练后的模型与初始模型的参数距离,比专业教师模型与初始模型的距离小了约150倍。这解释了为什么MOPD难以在参数变动极其有限的情况下完整地学习全新的、未曾在预训练中见过的规划知识——小剂量的更新根本不够把一套完全陌生的知识体系刻进模型参数里。

九、研究成果汇总:从厨房到全局视野

把这三个阶段的研究结论拼在一起,就形成了一张关于AI长程规划能力的完整地图。

在预训练阶段,最重要的三件事是:让AI在内心建立关于环境运转方式的"世界模型"(而非只背动作序列);在以简单数据为主的训练集里加入少量长程演示(哪怕只有5%也能激活长程规划能力);以及严格控制数据质量(一旦混入次优轨迹,长程任务的表现就会呈指数级崩溃)。

在后训练阶段,关键在于区分"规划模式"和"规划知识"这两类不同性质的能力。规划模式是跨任务共享的通用思维框架,适合用强化学习来强化,OPD在数据质量差、任务步骤长的困难场景下比GRPO有更宽的有效区域;规划知识是任务特定的程序性知识,强化学习对它无能为力甚至有害,更适合通过监督微调(SFT)来注入。

在多教师融合阶段,MOPD能否成功取决于不同领域的教师是否共享兼容的规划模式:共享且兼容,则实现跨领域泛化;部分共享但存在冲突,则支持持续学习但有一定遗忘;完全不共享且相互冲突,则导致灾难性遗忘和跨领域干扰。

说到底,这项研究提供了一套前所未有的、系统性的视角来理解AI智能体的长程规划能力是怎样被构建起来的。它最重要的贡献不是某一个具体的技术突破,而是对"能力从哪里来、在哪里成形、能往哪里扩展"这些基础性问题给出了受控实验下可验证的答案。

对于从事AI系统开发的人来说,这些结论有非常直接的实践指导价值:花时间构建高质量的预训练数据(尤其是世界模型格式的数据)远比试图用强化学习事后弥补更有效;不同任务共享规划模式是多教师融合能否成功的前提条件;以及OPD虽然在困难设置下比GRPO更稳健,但它压制多样性这一特点意味着对教师模型的质量要求极高。

对于普通人来说,这项研究背后有一个更直白的启示:AI变聪明的方式,和人类学习的方式其实有很多共通之处。好的基础教育(预训练)、有针对性的实践训练(后训练)、以及向不同领域的优秀导师学习(多教师融合)——这些在人类教育体系里反复验证过的原则,在AI的训练过程中同样成立,只是背后的机制在受控实验的解剖刀下,第一次变得清晰可见。

有兴趣进一步了解这项研究的读者,可以通过arXiv编号2607.24720搜索到完整论文,其中还包含实验代码、数据集和模型权重的开放获取链接,供研究人员复现和扩展这些工作。

Q&A

Q1:AI的"世界模型内化"训练方式和直接预测动作的训练方式有什么本质区别?

A:直接预测动作的AI学的是"背食谱"——给定当前状态,凭记忆输出下一步操作,不理解为什么要这么做。世界模型内化则让AI在行动前先在内心推演:目标是什么,当前缺少什么,合成某个中间物品需要什么前提条件,这些前提是否在库存里……通过这种逐层分析,AI真正理解了环境的运转规律。研究数据显示,这种差异在短程任务里不明显,但在长程任务(9步以上)中,世界模型方式的成功率比直接预测高出约46个百分点,因为长程任务中每一步的推理都依赖于对前因后果的完整理解,而不是简单的条件反射。

Q2:多教师融合训练为什么有时候会导致AI忘掉之前学的东西?

A:多教师融合(MOPD)的核心机制是让模型向不同领域的教师依次学习,但它会收敛到各个教师共同认可的规划模式上。当不同教师之间不存在共同的规划模式,且各自的规划思维方式还相互冲突时,模型会对最新学习的教师过度适应,把那位教师的偏好强行推广到所有领域。如果这种被强化的规划模式在其他领域里实际上是错误策略,就会触发这些领域中对应的"坏习惯",导致旧领域的性能大幅下降。研究中的极端案例显示,完全无共享且冲突的模式会让某个领域的成功率从90%暴跌至15%。

Q3:为什么用"完美教师"做在线策略蒸馏(OPD)训练,学生的表现有时反而会变差?

A:这种反直觉的现象发生在教师和学生拥有不同"内心知识体系"的情况下。当学生在预训练中已经学会了完成同一目标的路径A,而教师按照路径B来指导时,教师从路径B视角给出的每一步"正确操作",在学生路径A的世界模型框架里看起来都是"奇怪的"。OPD通过KL散度损失强行拉近学生和教师的输出分布,这个拉扯过程会干扰学生原有的路径A知识,但又因为强化学习本身每次参数更新幅度极小,不足以完整建立路径B的新知识,最终学生陷入"旧知识被破坏、新知识未建立"的混乱中间态,表现反而不如训练前。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-