微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 清华、浙大等高校联手破解AI智能体"只知结果不懂过程"的训练难题

清华、浙大等高校联手破解AI智能体"只知结果不懂过程"的训练难题

2026-06-30 11:48
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-30 11:48 科技行者

这项由清华大学、浙江大学、香港中文大学、南洋理工大学以及同济大学共同参与的研究,于2026年6月以预印本形式发布,论文编号为arXiv:2606.26790,感兴趣的读者可以通过这个编号检索到完整论文。

**训练一个会"举一反三"的AI,比你想象的难得多**

假设你正在训练一个新来的快递员。每天结束后,你只告诉他"今天的包裹送到了"或者"没送到",却从不解释他在哪个路口走错了方向、哪次敲门方式不对导致没人应答。这种只有最终成绩、没有过程指导的培训方式,效率可想而知——快递员只知道自己成功或失败了,但不清楚具体哪一步出了问题,下次可能还会犯同样的错。

当前最先进的AI智能体训练,正面临着几乎完全相同的困境。研究人员用强化学习的方式来训练能够完成复杂任务的AI,比如让AI在虚拟家居环境中整理物品、在网上购物平台上搜索商品、或者通过搜索引擎回答问题。这类任务往往需要AI连续做出十几步甚至几十步决策,但训练信号只有最终的"成功"或"失败"——AI完成了任务就得1分,没完成就得0分,中间那几十个决策步骤,哪个做得好哪个做得差,全靠AI自己摸索。

这种训练方式被称为"基于结果的强化学习",其代表方法叫GRPO(一种无需额外评估模型的策略优化算法)。它的优点是稳定可靠,缺点也很明显:就像那个只收到最终成绩单的快递员,AI很难从稀疏的奖励信号中学会精细的决策技巧,尤其是在需要连续做出多步决策的长程任务中,一个早期的小失误可能在很多步之后才显现出后果,让AI几乎无从归因。

正是为了解决这个问题,研究团队提出了一个名为OPID(On-Policy Skill Distillation,即在线策略技能蒸馏)的全新训练框架。这个框架的核心思路,是把AI自己跑完的每一段完整经历——无论成功还是失败——都当作一本可以翻阅和学习的"经验手册",从中提炼出具体的行为智慧,再反哺给AI的训练过程,让每一次尝试都能产生比单纯"成功/失败"判断更丰富的学习信号。

**一、为什么"只看结果"的训练方式在复杂任务上会卡壳**

要真正理解OPID解决的是什么问题,可以用一个更贴近生活的比喻来感受一下这种困难的程度。

考虑一位正在学习下围棋的初学者。如果每盘棋结束后,教练只告诉他"这局你输了",却不指出他在第15手时的一个关键落子失误导致了棋局的崩溃,也不说明第30手时他本可以用一招妙手逆转局势,那么这位初学者要提升棋力,只能靠大量重复对局,希望自己能从无数次的胜负中慢慢悟出规律。这个过程既漫长又低效。

AI智能体面对的正是这种处境,而且情况往往更糟。在AI需要执行的任务里,一次完整的任务可能包含二三十个连续决策步骤,每个步骤都需要AI根据当前状态做出判断。最终的奖励信号只有一个,却要被"摊薄"到几十个步骤上,每一步获得的有效训练信息少得可怜。

更棘手的是,有些错误具有"延迟爆炸"的特性——AI在第5步时拿错了物品,但直到第25步它才发现自己手里拿的根本不是任务要求的东西,这时候已经浪费了20步的行动。纯粹依靠"成功/失败"的结果信号,几乎无法让AI理解这种延迟因果关系。

与此同时,学术界也有一些试图引入更密集训练信号的方法,其中一类叫做"技能条件化自蒸馏",意思是给AI的"教师分身"额外提供自然语言写成的行为经验描述(也就是"技能"),让教师分身在这些经验指导下对同一个动作给出更精准的评分,然后让学生分身向教师分身学习。但现有的这类方法有个共同缺陷:技能经验来自外部维护的知识库或检索系统,维护这个库既费时费力,而且检索来的技能描述的是"理想情况下应该怎么做",未必契合当前AI正在经历的具体场景——就像给一个正在小巷里迷路的快递员塞一本写着"大街上最优行驶路线"的手册,帮助相当有限。

OPID的出发点就是彻底绕开这个问题:不从外部检索技能,而是从AI自己刚刚跑完的轨迹里提取经验,确保每一条训练信号都与AI当前所处的状态分布高度吻合。

**二、OPID如何把"走过的弯路"变成"宝贵的课程"**

理解OPID的运作方式,可以用一个"即时复盘"的比喻来类比。

设想一位足球教练,他的独特之处在于:每场比赛结束后,他立刻召集球员复盘,不仅总结整场比赛的战术得失(比如"今天我们的高位逼抢很奏效"或者"我们在定位球防守上一再出现同样的漏洞"),还特别标出比赛中两三个关键转折时刻,专门分析那几个时刻球员应该做什么不同的选择。然后,这位教练把这些经验转化成球员在下一场比赛前可以内化的战术意识,而不是把它们写成一本厚厚的战术手册让球员在比赛中翻阅。

OPID做的事情和这位教练非常类似,整个流程分为三个环环相扣的阶段。

第一个阶段,是从已完成的轨迹中提取层级化的"技能"。OPID让AI按照当前策略运行一批完整任务,每个任务都跑出一条完整轨迹——包括所有的观察、决策和最终结果。然后,一个基于大语言模型的"分析器"会阅读每条轨迹,提炼出两个层次的经验描述。

第一个层次叫"情节级技能",相当于足球教练对整场比赛的总结复盘。对于成功完成的任务,情节级技能描述的是整个任务的有效工作流程,比如"先定位目标物品,再移动到清洗站,清洗后放置到指定位置";对于失败的任务,情节级技能描述的是应该避免的错误模式,比如"不要在未确认物品是否干净的情况下直接将其放入目标位置,重复移动同一物品而不执行清洗步骤是主要警示信号"。这类技能比较宏观稳定,适合作为大多数决策步骤的默认指导。

第二个层次叫"步骤级技能",相当于教练对比赛中那两三个关键转折时刻的专项分析。分析器会在整条轨迹中识别出少数几个"关键时间步"——那些对最终结果影响最大的决策点,比如"在第2步,应该直接去看储物台而不是先检查库存",或者"在第4步,应该立刻前往水槽清洗,而不是先探索其他房间"。步骤级技能高度具体,但只针对那几个真正关键的决策节点。

在整个训练过程中,每条轨迹平均只被识别出大约3到4个关键时间步,远少于总步骤数,说明OPID的步骤级监督是高度选择性的,而非对每一步都进行密集干预。

**三、"优先响应关键时刻"的智能路由机制**

提炼出两类技能之后,OPID面临一个实际问题:在执行轨迹的每一步,究竟应该用哪一类技能来提供指导?

研究团队设计了一个"关键优先路由"机制,逻辑非常直接。对于被分析器识别为关键时间步的那几个节点,系统会把对应的步骤级技能注入进去,因为这几个节点需要最精准的局部决策指导。对于其余所有"普通"时间步,系统则使用情节级技能作为默认背景指导,提供全局性的行为框架。

这个设计背后有一个重要的直觉:情节级技能像是给快递员一张城市地图,告诉他整体走哪条路线最高效;步骤级技能则像是在某个特别复杂的路口专门安排了一个向导,在最容易走错的地方提供精确指引。大多数路段有地图就够了,但在那几个关键路口,光靠地图不够,需要更精确的现场指导。如果把两者不加区分地叠加在每一步,反而会造成信息干扰。论文中的消融实验验证了这一点:去掉路由机制、在所有步骤同时叠加两类技能,性能比有路由机制的版本下降了接近7个百分点。

**四、把技能转化为"密集的训练信号"**

确定了每一步该用哪类技能之后,OPID需要把这个技能实际转化成对训练有用的信号,这一步是整个框架最精巧的地方。

具体做法是这样的:系统把已选定的技能描述插入到AI的交互历史中,形成一个"技能增强版历史记录"。然后,系统用训练开始时那个版本的AI策略,分别计算同一个实际生成的回应在"原始历史"和"技能增强历史"两种语境下被预测的概率。

如果某个词元(可以理解为句子里的一个词或词片段)在技能增强语境下被预测的概率更高,说明这个词的选择符合技能所描述的经验,值得被强化;如果在技能增强语境下概率反而更低,说明这个词的选择与技能经验相悖,应该被压制。这个概率差值,就是所谓的"技能优势",它是一个逐词级别的密集信号,而不是整条轨迹共用一个值。

最终,OPID把这个逐词的技能优势,与传统GRPO框架提供的基于结果的情节优势相加,形成综合训练信号。原来那个只有最终成绩单的快递员,现在每走一步都能收到来自自己刚刚那次经历提炼出的具体反馈,训练效率自然大幅提升。

从理论上看,研究团队还证明了这个技能损失函数在数学上等价于一种"相对KL散度"——简单说,就是它既推动AI的决策概率向技能描述的方向靠拢,又不会让AI的行为飘离原来策略太远,兼顾了学习效率和训练稳定性。

另外一个设计上的亮点是:这套分析器、技能提取、技能注入的流程,完全只在训练阶段使用。训练结束之后,AI在实际执行任务时,完全不需要调用任何分析器或检索任何技能描述,只凭训练中内化的能力独立行动。这避免了推理阶段的额外计算开销,也消除了"训练时有技能指导、测试时没有"所带来的表现差异。

**五、在三个不同类型的任务上全面验证**

研究团队在三个具有代表性的智能体任务基准上进行了系统性评测,分别代表了不同场景下的长程决策挑战。

第一个是ALFWorld,一个文字版的家居场景模拟环境。AI需要完成诸如"找到一个锅铲,清洗后放到餐桌上"这样的任务,通过一系列文字指令与环境交互,最多允许连续30步操作。任务被细分为六种类型:拿取、查看、清洗、加热、冷却和双物品拿取。

第二个是WebShop,模拟在电商平台上购物的场景。AI需要根据自然语言描述的购物需求,通过搜索、浏览商品页面、选择属性、最终下单完成任务,评分标准包括匹配度得分和完全成功率两项。

第三个是Search-based QA,一个搜索增强的问答场景。AI需要通过与搜索引擎交互来回答问题,涵盖七个不同的问答数据集,包括简单事实题、多跳推理题等不同难度类型。

实验在三个不同规模的模型上进行:Qwen2.5-3B(约30亿参数)、Qwen2.5-7B(约70亿参数)和Qwen3-1.7B(约17亿参数),覆盖了小中大不同体量,确保结论的普遍性。

实验结果的整体图景是这样的:在ALFWorld和WebShop上,OPID普遍实现了对所有基线方法的超越,在搜索问答任务上也维持了强竞争力。以Qwen2.5-3B为基础模型为例,OPID在ALFWorld上的平均成功率达到了84.3%,相比纯结果导向的GRPO方法的75.0%提升了超过9个百分点;在WebShop上的成功率达到74.2%,比GRPO的63.3%高出近11个百分点;在搜索问答上的平均准确率达到45.0%,比GRPO的36.4%高出8.6个百分点。

对于参数量最小的Qwen3-1.7B模型,提升效果尤为突出。这个小模型在WebShop上的成功率从纯强化学习的38.3%跃升至64.8%,提升幅度超过26个百分点,说明OPID对小模型的帮助更大——毕竟小模型本身储备的行为经验较少,来自轨迹的额外指导信号对它们的价值更高。

**六、与其他技能训练方法的公平比较**

除了与纯结果导向的GRPO对比,研究团队还与多个引入了技能或自蒸馏机制的强化学习方法进行了横向比较,包括Skill-GRPO(在训练时提供技能描述的GRPO变体)、Skill-SD(技能条件化自蒸馏)、RLSD(用技能信号调节各步骤更新幅度)以及SDAR(结合了强化学习与自蒸馏的综合方法)。

其中有一组对比特别能说明问题。Skill-GRPO这个方法在训练时给AI提供了来自外部的技能描述,但在测试时把技能描述撤掉,结果在ALFWorld上三个模型的成功率比纯GRPO分别下降了14.8、11.7和25个百分点——训练时靠技能"拐杖"走路,测试时把拐杖撤掉就摔倒了,说明技能没有真正内化到模型参数里。OPID在测试时同样不使用任何技能描述,成绩却比这些依赖外部技能的方法高出20到37个百分点,证明OPID确实做到了把轨迹经验"内化"而非"依赖"。

即便是对标测试时保留技能描述的Skill-GRPO*版本(即训练测试都有技能辅助),OPID在ALFWorld和搜索问答任务上的两个Qwen2.5模型规格上仍然全面超越,进一步验证了从在线轨迹中提取的分布匹配技能的独特价值。

**七、训练过程中的动态变化与样本效率优势**

研究团队还仔细观察了训练过程中AI行为的变化趋势,结果很有意思。在ALFWorld的训练曲线上,OPID和GRPO在最初阶段进步速度相似,但到了中间阶段,OPID开始明显拉开差距,并在此后持续领先直至训练结束。这种"中期分化"的现象说明,技能指导的价值在AI掌握基本任务结构之后才真正显现,这时候细粒度的决策指导才能发挥最大作用。

更值得关注的是效率层面的表现。OPID训练出的AI不仅成功率更高,完成任务所需的平均步骤数也更少——OPID智能体完成任务平均需要15到16步,而GRPO智能体则需要17到18步。步数的减少意味着AI学会了更直接有效的行动序列,减少了无效探索和重复动作。

在数据利用效率上,实验显示只用60%的训练数据,OPID就能达到GRPO用100%数据训练时的接近水平;用80%的数据,OPID已经明显超越GRPO的满数据结果。各个数据规模下,OPID的绝对优势在9到20个百分点之间,低数据区间的优势反而更大,这恰恰说明技能监督的价值在于从有限的轨迹中提取更多信息,而不只是在数据充裕时锦上添花。

**八、迁移到陌生环境:技能真的被内化了吗**

为了验证AI学到的是可迁移的行为智慧而非单纯记住了训练场景,研究团队专门在ALFWorld的"未见分割"测试集上评估了OPID,也就是在训练中从未见过的环境配置上测试。

结果显示,OPID在未见环境上的平均成功率达到78.6%,比GRPO的70.9%高出7.7个百分点。其中提升最显著的是"查看"类任务(提升26.7个百分点)和"加热"类任务(提升18.5个百分点),其他类型任务也保持了竞争力。由于技能在训练结束后已经融入模型参数,这种在陌生环境下的持续优势确实表明,OPID帮助AI内化了可复用的行为结构,而非简单地记住了特定的场景-动作映射。

**九、一个具体案例展示两种训练方式的差异**

研究团队还提供了一个具体的轨迹对比案例,生动展示了OPID和纯GRPO训练出的AI在实际行为上的差异。

任务是:"清洗一把铲子并放到餐桌上"。

用GRPO训练的AI从第1步开始就出现了问题:它先查看库存,然后在餐台上找到了铲子并取走,看起来一切正常。但到了第10步,AI转向了水槽,却突然对水槽里的一把勺子产生了兴趣,拿起了勺子。随后,AI用接下来十几步清洗了勺子,把勺子放到了餐桌上,认为完成了任务。整个轨迹中,AI始终持有铲子,但在某个中间步骤突然发生了"目标替换",用勺子代替了铲子,最终在30步耗尽前仍未完成真正的任务要求,宣告失败。这种行为反映了在没有精细步骤级监督的情况下,AI容易在长程任务中"走神",混淆任务目标。

用OPID训练的AI则展现了截然不同的行为模式。第1步直接走向餐桌检查铲子的位置,第2步取走铲子,第3步走向水槽,第4步执行清洗,第5步返回餐桌,第6步完成放置——6步干净利落地完成了任务。每一步的推理都紧扣任务目标,没有任何无效动作或目标混淆。这种"定位-清洗-放置"的工作流程,正是情节级技能所描述的全局行为模式;而每个关键决策节点上的准确行动,则体现了步骤级技能内化的效果。

说到底,OPID做的事情,是把"吃一堑长一智"这个人类学习中最朴素的智慧,用一套严谨的技术框架实现在了AI的训练过程中。它不仅告诉AI"这次做得对不对",更从AI自己走过的每段经历里提炼出"下次怎么做更好"的具体指导,而且这些指导与AI当前所处的状态高度匹配,不存在"书本知识与实际情况脱节"的问题。

训练结束之后,AI把这些经验完全内化,在实际执行任务时不需要任何外部支持,就能展现出更高效、更稳健的行为表现。这对于AI智能体的实际部署具有相当实际的价值,毕竟在真实应用场景中,你很难保证总有一个现成的知识库等着被检索。

对于那些对AI智能体训练感兴趣的读者,这项研究提出了一个很值得思考的问题:在人类的学习成长过程中,"复盘自己的经历"和"向外界寻求指导"这两种方式,各自适合什么场合?AI的训练方式是否应该更多地向人类的自我反思学习机制靠拢?感兴趣的读者可以通过arXiv编号2606.26790查阅完整论文,深入探索这个方向的更多技术细节。

---

Q&A

Q1:OPID训练出来的AI在执行任务时还需要额外的技能描述支持吗?

A:不需要。OPID框架中的技能提取和技能注入流程只在训练阶段使用,训练结束后这些经验已经融入AI的模型参数中。执行任务时,AI完全依靠自身已内化的能力行动,不需要调用任何分析器、检索任何技能文件或接受任何外部提示,这也是OPID相比依赖外部知识库的方法的一个重要优势。

Q2:OPID中的"情节级技能"和"步骤级技能"有什么具体区别?

A:情节级技能是对整条任务轨迹的宏观总结,成功轨迹提炼的是可复用的全局工作流程,失败轨迹提炼的是应该避免的错误模式;步骤级技能则是针对轨迹中少数几个关键决策节点的具体行动指导,更精准但也更局部。OPID通过关键优先路由机制,在关键节点使用步骤级技能,其余节点使用情节级技能作为默认指导。

Q3:OPID在小模型上的提升效果为什么比大模型更显著?

A:参数量较小的模型(如Qwen3-1.7B)自身储备的行为经验和泛化能力相对有限,在面对复杂长程任务时更容易因缺乏精细指导而走弯路。OPID提供的来自在线轨迹的密集技能监督,恰好弥补了小模型在行为智慧上的短板,因此提升空间更大。以WebShop任务为例,OPID让Qwen3-1.7B的成功率从38.3%提升至64.8%,提升幅度超过26个百分点。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-