微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 阿里巴巴团队推出Complementary RL:让AI智能体像人脑一样积累和运用经验的学习新法

阿里巴巴团队推出Complementary RL:让AI智能体像人脑一样积累和运用经验的学习新法

2026-03-27 11:01
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-03-27 11:01 科技行者

这项由阿里巴巴集团与香港科技大学联合开展的研究发表于2026年3月的arXiv预印本平台,论文编号为arXiv:2603.17621v1,为大语言模型智能体的强化学习训练带来了突破性进展。

当我们在日常生活中学习新技能时,大脑会自动记住有用的经验,并在面临相似情况时调用这些经验来帮助我们做出更好的决策。然而,现有的AI智能体却像是患了"失忆症"的学生,每次都从零开始,无法很好地利用之前的学习经历。阿里巴巴的研究团队受到人类大脑工作机制的启发,开发出了一种全新的学习方法——互补强化学习(Complementary Reinforcement Learning),让AI智能体也能像人类一样积累经验、学会运用,从而大幅提升学习效率。

现在的AI智能体在学习过程中面临着一个严重问题:它们只能从任务成功或失败的最终结果中学习,就像一个学生只知道考试分数,却不知道哪道题做错了、为什么错了。这种学习方式效率极低,因为大量有价值的过程信息被白白浪费了。更糟糕的是,即使AI在某个任务中获得了宝贵经验,当面对下一个类似任务时,这些经验却无法被有效利用,就像每次都要重新发明轮子一样。

研究团队深入分析发现,现有方法虽然尝试让AI利用历史经验,但存在一个致命缺陷:经验管理系统是静态的,无法随着AI能力的提升而同步进化。这就像给一个成年人提供小学生的学习资料,或者给初学者提供高深的专业知识,两者都无法产生良好效果。随着训练的进行,这种不匹配会越来越严重,最终导致经验不仅无法帮助学习,反而可能成为负担。

为了解决这个问题,研究团队从神经科学中的互补学习系统理论中汲取灵感。人类大脑有两套互补的学习机制:大脑皮层负责长期的、结构化的知识存储,而海马体则负责快速的情景记忆管理。这两个系统会相互配合,海马体会根据皮层反馈来决定哪些记忆值得巩固,而皮层则利用海马体提供的记忆来加强决策能力。

基于这一发现,研究团队设计了互补强化学习框架,包含两个核心组件:一个是负责执行任务的策略智能体,另一个是负责管理经验的经验提取器。关键的创新在于,这两个组件会在学习过程中相互影响、共同进化。策略智能体通过任务成功与否来获得奖励并改进自己的行为,而经验提取器则根据自己提供的经验是否确实帮助了策略智能体成功来调整自己的经验管理策略。

这种共同进化机制确保了经验的质量和相关性会随着智能体能力的提升而不断改善。当策略智能体变得更强时,它会生成更高质量的行为轨迹,为经验提取器提供更好的学习材料;而经验提取器通过分析这些高质量轨迹,能够提炼出更有价值的经验,进而为策略智能体提供更精准的指导。

在具体实现上,研究团队设计了一套精巧的训练机制。对于策略智能体,他们创新性地将训练数据分为两组:一组在有经验指导的情况下执行任务,另一组则不使用任何经验。这种设计避免了智能体过度依赖外部经验而忽视自身能力发展的问题。通过分组计算优势函数,确保两种条件下的学习信号都能得到充分利用。

对于经验提取器,团队采用了CISPO优化算法来确保训练稳定性。当经验提取器生成的经验帮助策略智能体成功完成任务时,它会获得正向奖励;反之则获得负向奖励。这种直接的反馈机制让经验提取器能够快速学会什么样的经验是有用的,什么样的经验应该被淘汰。

为了支持这种复杂的双模型协同训练,研究团队还开发了一套高效的异步训练框架。这个框架的核心是一个名为ExperienceManager的中央管理器,它就像一个高效的图书馆管理员,负责协调经验的存储、检索和更新。通过这种设计,策略智能体可以持续与环境交互而不被经验管理过程阻塞,同时经验提取器也能在后台稳定地处理和优化经验库。

在经验检索方面,团队实现了批量查询和并行搜索机制,大大提高了系统的吞吐量。当多个环境同时请求经验时,系统会将这些请求打包处理,并利用多个并行工作线程进行语义相似度搜索,确保每个智能体都能及时获得最相关的经验指导。

更有趣的是,研究团队还引入了一个"搜索并询问"工具,允许策略智能体在执行任务过程中主动查询经验库。当智能体遇到困难或不确定的情况时,它可以根据当前状态构造查询,获取针对性的经验帮助。这种机制不仅提高了经验利用率,还为经验提取器提供了更多样化的训练信号。

为了防止经验库中出现重复或冲突的条目,系统还实现了定期合并机制。经验提取器会定期分析经验库中的内容,识别语义相似的经验并进行合并,同时删除过时或低质量的经验。这确保了经验库始终保持精简而高效的状态。

实验验证阶段,研究团队在四个不同类型的环境中测试了这一方法的有效性。在MiniHack游戏环境中,智能体需要在迷宫中导航并避开陷阱到达目标。WebShop环境模拟网购场景,智能体需要根据用户需求搜索和购买合适商品。ALFWorld提供家务场景,智能体需要通过自然语言指令完成各种家庭任务。SWE-Bench则是真实的软件工程基准,智能体需要修复GitHub上的实际代码问题。

在单任务训练实验中,互补强化学习在所有四个环境中都显著优于传统的不使用经验的基线方法。在MiniHack和ALFWorld这类需要策略性探索的任务中,性能提升达到了1.3倍,并且训练过程更加稳定。在具有挑战性的SWE-Bench软件工程任务中,新方法实现了3%的性能提升。更令人印象深刻的是,互补强化学习不仅提高了成功率,还显著提升了任务执行效率。在MiniHack中,智能体完成任务所需的平均步数减少了1.5倍,在ALFWorld中更是减少了2倍,这表明通过经验学习,智能体确实掌握了更高效的决策策略。

多任务训练实验进一步验证了方法的通用性和可扩展性。当同时在三个不同任务上进行训练时,互补强化学习相比基线方法实现了7%的性能提升。更重要的是,研究团队通过对比实验发现,简单地使用静态经验库几乎无法带来改善,甚至在某些情况下会降低性能,这证实了经验提取器协同进化的重要性。

为了深入理解方法的工作机制,研究团队还进行了多项消融实验。结果显示,当移除定期合并机制时,经验库中会积累大量冗余信息,导致检索质量下降。当禁用"搜索并询问"功能时,经验利用率明显降低,智能体的学习效率也随之下降。这些实验结果验证了框架中每个组件的必要性。

在模型规模对比实验中,研究团队发现使用更大的经验提取器模型能够进一步提升整体性能。当将经验提取器从4B参数扩展到30B参数时,平均性能提升了5%,这表明更强的经验提取能力确实能够产生更有价值的指导信息。

延迟分析实验证明,尽管引入了复杂的经验管理机制,但通过精心设计的异步架构,系统几乎没有为智能体的环境交互引入额外延迟。在不同规模的并行环境下,经验检索的平均时间都保持在1秒以内,这对于实际应用是完全可以接受的。

任务扩展性实验进一步证明了方法的实用价值。当从3个任务扩展到6个任务时,互补强化学习的性能优势不仅没有下降,反而从6.6%提升到了8.1%,这表明随着任务多样性的增加,跨任务经验共享带来的益处会更加明显。

这项研究的意义远超技术层面的创新。在实际应用前景方面,这种能够持续学习和积累经验的AI智能体可以部署在需要长期运行的复杂环境中,如智能客服系统、自动化运维、个人助理等场景。随着运行时间的增长,这些系统会变得越来越智能,能够处理越来越复杂的情况。

从技术发展角度来看,互补强化学习为AI领域指出了一个重要方向:不是简单地增大模型规模或收集更多数据,而是让AI系统具备持续学习和自我改进的能力。这种范式转变可能会影响未来AI系统的设计思路,从追求一次性训练的完美模型转向构建能够持续进化的智能系统。

研究团队在论文中也诚实地指出了当前方法的一些限制。经验提取器的训练仍然面临稳定性挑战,特别是在任务描述多样性较低时容易出现数据冗余问题。为了解决这些问题,他们引入了检索多样化和训练计数感知的优势重加权等技术,但承认仍有改进空间。

另外,虽然异步训练框架显著提升了效率,但在大规模部署时仍需要仔细调优各种参数,如查询批次大小、并行工作线程数量等。这要求实际应用者具备一定的系统调优经验。

展望未来,这项研究为AI智能体的发展开辟了新的道路。可以预见,未来的AI助理不再是今天这样需要频繁重新训练的"健忘"系统,而是能够从每次交互中学习、持续改进的真正智能伙伴。当这种技术进一步成熟并与其他AI技术相结合时,我们可能会看到真正意义上的通用人工智能的雏形——不仅能够执行特定任务,更能够像人类一样不断学习、积累智慧、适应变化。

说到底,这项研究最大的价值在于它重新定义了我们对AI学习能力的理解。不是让机器简单地模仿人类行为,而是让它们真正掌握学习本身的艺术。就像一个优秀的学生不仅要掌握知识,更要学会如何学习一样,未来的AI系统也需要具备这种"学会如何学习"的元能力。阿里巴巴团队的这项工作为实现这一目标迈出了重要一步,为我们展示了一个更加智能、更加自主的AI未来。

Q&A

Q1:互补强化学习与传统强化学习有什么区别?

A:传统强化学习只能从任务成功失败的结果中学习,无法有效利用历史经验。互补强化学习包含两个相互配合的组件:策略智能体和经验提取器,它们会共同进化,经验质量随着智能体能力提升而不断改善,就像人脑的大脑皮层和海马体协同工作一样。

Q2:这种方法在实际应用中有什么优势?

A:最大优势是持续改进能力。部署后的AI系统会随着运行时间增长变得越来越智能,能处理越来越复杂的情况。在实验中,新方法不仅提升了10%的任务成功率,还将完成任务所需步数减少了1.5-2倍,显著提高了效率。

Q3:普通用户什么时候能体验到这种技术?

A:目前这还是研究阶段的技术,但可以预期未来几年内会逐步应用到智能客服、个人助理、自动化运维等场景。当技术成熟后,用户将体验到真正能够学习和记忆的AI助手,它们会随着使用时间增长而变得更加贴心和高效。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-