微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 AI智能体一边工作一边学习,靠谱吗?一篇论文戳破了"自我进化"的滤镜

AI智能体一边工作一边学习,靠谱吗?一篇论文戳破了"自我进化"的滤镜

2026-08-19 12:10
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-08-19 12:10 科技行者

2024年前后,AI圈子里流行起一个说法:让大语言模型智能体在执行任务的过程中不断积累经验,越用越聪明。这个思路听起来特别自然,就像人一样,做的事情多了,经验就攒起来了,下次遇到类似问题就能处理得更好。于是一批叫做"自我进化"的方法陆续被提出来,有的往对话上下文里塞策略,有的建立记忆库,有的攒一套可复用的技能包。

但这里有个问题几乎没人认真问过:这些方法是怎么被测试出"有效"的?

答案有点尴尬。绝大多数研究的做法是,让智能体在同一个基准测试集里反复做题,每道题解决完就清空状态,重新开始下一道。这种测试方式有个专门的名字,叫独立评估。

**独立评估:每完成一个任务就把智能体的状态清零,任务之间互不影响,性能是分别算完再求平均的评估方式。**

问题就出在这里。真实世界里,没有人会把工作任务打包成一个个孤立的单元,做完一个就清空脑子重新开始。一个智能体今天可能在处理软件开发的问题,明天切换到客服对话,后天又要去查资料写报告。任务领域会切换,任务之间没有明确的边界提示,也没有人告诉它"现在开始是新任务了"。这种情况下,那些在独立评估里表现亮眼的自我进化方法,到底还灵不灵?没人知道,因为几乎没人这么测过。

这就是这篇来自微软和中科院自动化所团队的论文要回答的问题。他们搭了一个叫AgentStream的评估框架,把这个悬而未决的问题摆到台面上,狠狠地测了一遍。测完之后,很多原本被默认成立的假设,都被推翻了。

问题到底难在哪:从"做题"到"过日子"

先说清楚这篇论文测的是什么样的智能体。

**自我进化智能体:在部署运行期间,通过反思自己的执行经历不断更新自身状态(比如上下文提示、记忆库、技能库或整套工作框架),从而在后续任务中表现得更好的智能体。**

这类方法按照更新的对象不同,大致分成四类。有的方法改的是提示词上下文,也就是喂给模型的那段说明文字;有的建立结构化的记忆系统,把过去的经验索引起来方便检索;有的攒一个技能库,把可复用的操作模式打包成模块;还有的是"整套装备升级",把系统提示、工具配置、记忆模块全部打包一起演化。

这几种思路都挺合理,各有各的道理。但论文作者盯上的不是这些方法本身的设计,而是评估它们的方式。他们指出,现有的研究基本都是"各测各的":一个方法配一个基准测试,测完出个数字,宣布自己比基线好多少。至于换个测试场景会怎样,模型能力强弱会不会影响结果,几乎没人系统地研究过。

打个比方,这就像是评价一个厨师的水平,只让他在自己最拿手的那道菜上反复练习,然后说"看,他做得很好"。可是真实的后厨是什么样的?客人点单是随机的,川菜、粤菜、西餐轮番上,厨师得在不同菜系之间灵活切换,还得记住哪些经验是通用的,哪些只适用于某道特定的菜。如果一直只在单一菜系里练手,你根本无法判断这个厨师碰到"今天做完宫保鸡丁,下一单是提拉米苏"这种情况会不会翻车。

如果不做这种混合场景的测试,会发生什么?答案很直接:那些号称"自我进化有效"的方法,可能只是在特定的、单一的测试环境里凑巧表现不错,一旦挪到真实的、任务混杂的部署环境,效果可能完全崩掉,甚至比什么都不做还差。这正是这篇论文想揭穿的地方。

AgentStream:三种"生活方式"下的智能体考验

AgentStream框架的核心设计思路是把任务流的组织方式做成可配置的,通过控制任务来自哪些基准、以什么顺序出现,模拟出智能体在部署时可能遇到的各种真实处境。

论文里设计了三种测试场景,分别叫Isolated(隔离)、Sequential(顺序)、Interleaved(交织)。

**Isolated(隔离场景):每个基准测试维护自己独立的进化状态,智能体在这个基准里积累的经验完全不会传给别的基准。**

这个场景其实就是传统独立评估的升级版,但和普通独立评估不同的是,这里智能体在同一个基准内部的多道题目之间,状态是持续累积的,只是跨基准的经验被完全隔开。

**Sequential(顺序场景):智能体按固定顺序依次处理多个基准(比如先做完编程任务,再做工具调用,再做对话任务……),进化状态在基准切换的时候也会保留下来,不清空。**

这模拟的是一种渐进式的部署场景:智能体先在一个领域里练手,然后被派去做另一个领域的活儿,之前攒的经验有可能帮上忙,也可能造成干扰。

**Interleaved(交织场景):来自所有基准的任务被打乱顺序,混在一条流水线里随机出现,智能体只有一个共享的进化状态,需要面对完全没有规律可循的任务切换。**

这是最贴近现实混乱程度的场景,前一秒可能在写代码,后一秒突然要处理一个客服对话,再下一秒又跳回浏览网页查资料。

三个场景的设计逻辑其实是层层递进地剥离"确定性"。Isolated测的是智能体能不能在同一领域里把经验用好,这是最基本的能力。Sequential测的是有序切换领域时,之前的经验是帮忙还是添乱。Interleaved测的是最极端的情况,也就是完全无序、无预警的领域跳转,智能体能不能靠自己判断哪些经验该用、哪些该扔。

论文团队在这三种场景下,交叉测试了三个当前最先进的基础模型(GPT-5.4、Gemini 3.1 Pro、Claude Opus 4.7),配上五种代表性的自我进化方法(ACE、A-Mem、ReasoningBank、AutoSkill,以及论文团队自己实现的Harness),跑在六个覆盖不同能力维度的智能体基准上,包括交互式编程任务AppWorld、函数调用测试BFCL、深度网络搜索BrowseComp-Plus、高难度学术推理HLE、真实代码修复任务SWE-bench Verified,以及对话协调任务Tau2。这是一次名副其实的"排列组合式"大考。

第一个发现:自我进化不是稳赚不赔的买卖

先说最基本的一个问题,自我进化到底有没有用?

答案是有条件的有用。在所有测试组合里,把智能体从"啥都不学"的原始基线状态换成"自我进化"状态,正向提升的比例是有的,但也有相当一部分场景是负向的,也就是学了反而变差了。

三种场景里,Isolated表现最稳,正向命中率达到75.7%,平均提升1.37个百分点。而两种跨领域场景Sequential和Interleaved,正向命中率都只有62.3%左右,提升幅度也明显更小。

这里出现了一个反直觉的结果。按照直觉,Interleaved任务完全打乱、毫无规律,应该是最难的场景,理论上应该比Sequential这种有序切换更容易出问题。但实际测出来的结果恰恰相反:Interleaved的平均提升是0.90%,反而比Sequential的0.75%更高,而且在15组模型方法配对里,Interleaved有10组胜过Sequential,只有5组落后。

这个反常现象背后的原因,其实和智能体如何调用经验有关,后面章节会详细拆解。但先说结论:任务打乱得越彻底,反而可能倒逼智能体更谨慎地筛选相关经验,而顺序切换看似"温和",却可能让旧领域的经验悄悄污染新领域的判断,造成隐蔽的负迁移。

**隔离场景是自我进化最靠谱的试炼场,跨领域场景中,任务彻底打乱的交织场景反而比按顺序切换的顺序场景表现更好,尽管前者理论上干扰更大。**

第二个发现:模型不够强,学了也白学

这可能是全文最扎心的一个结论:自我进化的效果,取决于底层模型本身够不够强。

数据显示,GPT-5.4在所有三种场景下,自我进化的平均收益都是负的,从-0.35%到-0.78%不等,15组测试里只有4组超过了原始基线。反观Gemini 3.1 Pro,15组里有14组正向提升,收益在1.98%到2.71%之间;Claude Opus 4.7则是13组正向,收益在0.90%到1.75%之间。

这个差异不是偶然,在三种场景下都稳定存在。

为什么会这样?论文给出的解释是自我进化存在一个"自举循环":智能体做对的任务越多,产生的高质量经验就越多,这些经验又能帮助后续任务做得更好,形成正反馈。但如果基础模型能力不够,一开始的成功率就低,那么积累起来的经验大多来自失败或者半成功的轨迹,从这种噪声里根本提炼不出有用的东西。

这就像给一个刚学做饭的新手厨师配一本"错误笔记本",让他每做一道菜就往里记点心得,指望他越记越会做菜。但如果他一开始连基本功都不扎实,做十道菜错八道,那这个笔记本里记的全是错误的教训,甚至会把错误的操作误当成"经验"固化下来。如果不设置这个能力门槛会怎样?答案就是GPT-5.4的表现:越"学习",反而越偏离正轨,因为学到的是一堆带噪声的失败样本,而不是可靠的成功模式。

更微妙的是第二层发现:收益和模型能力之间不是线性的,而是非单调的。在两个受益于自我进化的模型里,Gemini 3.1 Pro的平均收益(+2.37%)居然比Claude Opus 4.7(+1.23%)更高,尽管在原始基线上Claude是更强的模型。

而且这个差距会随着场景复杂度扩大。在Isolated场景里,两者的收益差是0.96个百分点;到了Sequential场景,差距是0.93个百分点;一旦进入Interleaved场景,差距直接拉大到1.51个百分点。

这说明了什么?一个已经很强的模型,在大多数基准上已经接近天花板,能通过学习再挤出来的提升空间自然有限。而一个中等能力的模型,还有很大的成长空间,混合多样任务带来的经验反而能让它吸收得更充分。这有点像给学霸和中等生同样布置一套跨学科综合练习题,学霸原本各科分数都接近满分,练习题带来的边际提升有限,而中等生原本某些科目比较薄弱,综合练习恰好能补上短板,进步幅度自然更大。

第三个发现:选对方法比选对模型更重要,而且没有万能公式

论文接下来分析了模型能力和方法选择之间的互动关系,这里面藏着一个很实用的结论。

不同自我进化方法之间的表现差距,会随着模型能力增强而收窄。在GPT-5.4上,最好和最差方法之间相差5.3个百分点,且只有1种方法能超过原始基线;到了Gemini 3.1 Pro上,差距缩小到2.0个百分点,五种方法全部超过基线;再到Claude Opus 4.7,差距进一步收窄到0.9个百分点,各方法表现都挤在一个很窄的区间里,且都比基线好。

这个趋势可以理解成,弱模型的时候方法架构决定生死,因为智能体本身能不能从大量失败经验里挖出可用信号,很大程度上取决于所用方法的设计是否精巧。而强模型的时候,各种方法都能可靠地产生正向迁移,方法选择的重要性自然被稀释了。

这里还有一个特别值得记住的结论:没有一种自我进化方法是"放之四海皆准"的。A-Mem在GPT-5.4上是表现最好的方法,但换到Gemini 3.1 Pro上就排到最后;ACE在Gemini上领跑,换到另外两个模型上却只能排第三。唯一一个在三个模型上都保持竞争力的,是ReasoningBank。

**方法选择不能照搬别人的经验,同一套自我进化方法在不同模型上的表现可能天差地别,必须针对具体模型单独挑选合适的方法。**

第四个发现:为什么"打散"反而更聪明

前面提到Interleaved场景表现居然优于Sequential,这个反常现象的答案,藏在不同方法处理经验的方式差异里。

论文把五种方法分成两大类:一类是上下文集成型,比如ACE和Harness,它们把积累的经验直接揉进智能体的提示词里,成为每次决策的固定背景;另一类是检索型,包括ReasoningBank、AutoSkill和A-Mem,它们把经验存在外部记忆库里,遇到新任务时才去检索最相关的那部分调用进来。

**检索式方法:将积累的经验存放在独立的记忆库中,任务到来时通过关键词或语义相似度检索出最相关的条目再注入使用,而不是把所有经验一股脑塞进提示词。**

数据显示,这两类方法在场景偏好上呈现出清晰的分野。上下文集成型方法在Isolated场景表现最好,ACE取得+2.28%的最高收益;而检索型方法则在Interleaved场景达到峰值,A-Mem在这种场景下取得+2.22%的收益。

背后的机制不难理解。上下文集成型方法把经验和执行上下文紧密绑定,在单一领域内这种绑定能转化成精准的领域策略,反复应用效果很好。但一旦任务流跨越多个领域,这种紧密绑定就成了负担,来自不相关领域的经验会污染当前决策。数据也印证了这一点:ACE的收益在Interleaved场景直接从+2.28%跌到-1.26%,Harness也从+1.91%降到+1.01%。

反过来,检索型方法因为有一道"筛选闸门",只在决策时调用与当前任务最相关的经验条目,这道闸门天然过滤掉了大量不相关的干扰。同时,多样化的交织任务流反而给这些方法提供了更丰富的原材料,让它们能提炼出跨领域通用的模式。

这个道理其实很像图书馆的两种藏书方式。一种是把所有笔记直接抄在一本随身携带的手册里,走到哪带到哪,遇到问题直接翻阅,速度快、上手方便,但如果你频繁在完全不相关的领域之间切换,这本手册会被越攒越厚、越来越杂乱,甚至可能把上一个领域的笔记误用到当前场景里。另一种是把所有笔记归档进一个大型索引系统,需要时输入关键词精准检索,虽然多了一步查找的功夫,但只要索引系统设计得当,即便面对成千上万条不同领域的笔记,也不会互相干扰。如果任务始终局限在同一个领域,第一种方式的即取即用优势更明显;一旦任务开始频繁跨界,第二种方式的筛选能力就成了决定性的优势。

顺手看看成本:自我进化会不会更烧钱

论文还专门算了一笔经济账,这一点在很多同类研究里常常被忽略。

结果显示,自我进化并不必然意味着更贵。在Gemini 3.1 Pro上,四种方法的实际成本反而低于原始基线,ReasoningBank把成本压到基线的64%,Harness压到71%,AutoSkill是82%,A-Mem是84%。这些方法同时还减少了智能体完成任务所需的平均步数,说明积累的经验确实帮智能体更高效地找到了解题路径。

但在GPT-5.4上,情况反了过来。大多数方法成本明显上升,A-Mem的成本一度飙到基线的577%,ACE也达到266%,只有ReasoningBank一枝独秀,把成本压到基线的92%。

结合前面提到的能力门槛结论,这个成本差异其实很好理解。GPT-5.4本身效果收益就是负的,弱模型攒的经验质量不高,智能体不但没学到有用的东西,反而可能因为反复试错、绕弯路而消耗更多算力,赔了夫人又折兵。而Gemini 3.1 Pro因为能有效吸收经验,经验反过来指导它走更少的弯路,省时又省钱。

三个模型的"学习性格"迥异

论文还深挖了三个模型在自我进化过程中积累状态的具体差异,这部分揭示了一件很有意思的事:不同的大模型,学习风格差别很大,就像不同的学生记笔记的方式完全不一样。

Claude Opus 4.7攒的经验体量最大,平均能生成1251条ACE策略条目,Harness技能库里的技能数量能到463个。Gemini 3.1 Pro则相反,攒的状态最精简,ACE条目只有209条,AutoSkill技能只有117个,但每条内容更浓缩。GPT-5.4则介于两者之间。

更有意思的是,Claude在使用Harness方法时,几乎把所有精力都花在扩充技能库上,系统提示和记忆部分只维持了9千字符左右,而Gemini恰恰相反,把大量篇幅(约2.9万字符)投入到集中化的系统提示和记忆里,技能条目相对更少。这说明Claude偏爱"把经验拆解成一个个具体可复用的技能模块",而Gemini偏爱"把经验浓缩成一份精炼的操作指南"。

在更新行为上,三个模型也各有各的"脾气"。GPT-5.4几乎是只增不改,300个任务里只对已有技能做了5次修订,系统提示一次都没动过;Gemini 3.1 Pro的更新分布更均匀,记忆和系统提示改了267次,技能修订了66次;而Claude Opus 4.7最为"勤快",在96%的任务后都会进行修订,而且几乎全部集中在打磨技能库上。

这种差异有点像三种不同性格的员工写工作日志。有人从不回头修改旧记录,只顾往前添加新内容;有人喜欢定期整理归纳,把零散信息浓缩成精炼的操作手册;还有人几乎每天都要回头翻修昨天写的内容,力求每条记录都尽善尽美。三种风格没有绝对的优劣,但确实会影响最终积累出来的知识体系是庞大而细碎,还是精炼而集中。

写在后面

读完这篇论文,最让人意外的地方不是"自我进化有时候没用"这个结论本身,而是它揭示了一个更深的评估陷阱:一个方法在孤立测试里表现优异,完全可能是因为测试环境天然规避了它的弱点,而不是因为这个方法真的鲁棒。

这让我联想到软件测试里的一个老问题。单元测试全绿不代表系统上线不出事,因为单元测试往往是在理想化的隔离条件下跑的,真实生产环境里各个模块之间会互相影响,会有你没预料到的边界情况。AgentStream这篇论文本质上是在给自我进化智能体做"集成测试",而不是停留在"单元测试"层面,这个视角的转变本身就很有价值。

还有一处细节值得单独说一说:Interleaved场景居然比Sequential更友好,这个结果一开始我也觉得反直觉,但仔细想想,顺序切换其实制造了一种"虚假的连续性",让智能体误以为前一个领域的经验依然适用,而彻底打乱的任务流反而逼着智能体时刻保持警惕,去主动判断"这条经验和当前任务到底相不相关"。有时候,看起来更混乱的环境,反而会倒逼出更谨慎的行为。这个道理或许不只适用于AI智能体。

如果自我进化的收益真的严重依赖底层模型能力,那么随着基础模型持续变强,未来是不是所有自我进化方法都会趋同变得同样有效?还是说,会出现新的能力天花板,让方法选择重新变得重要?这个问题,这篇论文没有给出答案,但已经把探照灯打到了对的地方。

Q&A

Q1:AgentStream是什么?

A:AgentStream是一个统一的评估框架,用来测试大语言模型智能体在"流式任务"场景下的自我进化能力,通过Isolated(隔离)、Sequential(顺序)、Interleaved(交织)三种测试场景,系统评估不同基础模型和自我进化方法组合的实际表现,而不是像以往那样只在孤立、单一的任务上做测试。

Q2:自我进化智能体一定比不学习的智能体表现更好吗?

A:不一定。论文发现自我进化的效果高度依赖底层基础模型的能力,能力较弱的模型(如GPT-5.4)在三种测试场景下都出现了负收益,也就是学了反而变差,而能力较强的模型(如Gemini 3.1 Pro和Claude Opus 4.7)才能稳定获得正向提升,且收益与模型强弱并非线性关系。

Q3:哪种自我进化方法最好用?

A:论文发现没有一种方法能在所有模型和场景下都表现最优。上下文集成型方法(如ACE、Harness)更适合任务领域单一的场景,检索型方法(如ReasoningBank、AutoSkill、A-Mem)更适合任务领域混杂交织的场景,而且最优方法会随着搭配的基础模型不同而变化,建议针对具体模型单独选择合适的方法。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-