
这项由吉林大学人工智能学院与沙特阿卜杜拉国王科技大学(KAUST)联合主导,多家机构参与合作的综述研究,于2026年7月14日以预印本形式发布于arXiv平台,编号为arXiv:2607.13104。研究团队跨越亚欧多个顶尖学术机构,系统整理了当前人工智能领域最前沿的一个方向——让AI系统学会自己改进自己。
如果你觉得"AI自我改进"这个词听起来像科幻电影里的情节,那你并没有猜错——这确实曾经只存在于科幻小说中。但现在,它正在以一种相当务实的方式走进现实。这篇综述就像一张巨大的地图,把这个领域里过去几年涌现出的数百项研究成果梳理得清清楚楚,告诉我们:AI自我进化这件事,今天的人类已经走到了哪一步?
要理解这篇论文在说什么,不妨用"汽车维修"作为一条线索贯穿全程。普通的AI就像一辆出厂后固定不变的汽车——你买到它的那一刻,它的性能就已经确定了,开久了只会越来越旧,除非你把车送去修理厂(也就是工程师介入重新训练它)。而这篇综述研究的,正是那些能够自己开进维修厂、自己诊断问题、自己换零件、甚至自己设计新零件的AI系统。这种能力,就叫做"自我改进"。
一、AI系统到底是什么构成的?先把"汽车"拆开看看
在正式进入研究内容之前,研究团队搭建了一套清晰的框架来描述现代AI系统的构造。这个框架是理解后续所有内容的基础。
现代的AI智能体(你可以把它理解为一个能执行复杂任务的AI系统)在结构上由两大部分组成。第一部分是"基础模型",这就像汽车的发动机——它是整个系统的核心动力来源,负责理解语言、进行推理和生成内容,比如GPT-4或Claude这样的大型语言模型。第二部分叫做"脚手架",这就像围绕发动机构建的整辆汽车——包括车身、方向盘、油箱、导航系统等等。在AI术语里,脚手架具体指的是系统给AI的指令(提示词)、AI记住事情用的记忆系统、AI能调用的各种工具(比如搜索引擎、计算器、代码执行器),以及控制AI怎么思考和行动的逻辑。
研究团队用一个数学式的表达来形容这个整体:AI在某个时刻的状态 = 发动机参数 + 脚手架配置。当AI"自我改进"时,它实际上在改变的就是这两样东西中的某一个,或者两个都改。
这个框架为什么重要?因为它让研究者们终于有了一套共同语言来比较和分类各种各样的"AI自我改进"方法。过去这个领域非常混乱,同样的事情被叫做不同的名字,不同的东西又被叫做同一个名字,这套框架把所有混乱理清了。
二、AI自我改进的两条大路:换发动机还是改车身?
根据这套框架,研究团队把现有的AI自我改进方法分成了两条根本性的路径,这两条路就像汽车升级的两种方案:换发动机,或者改装车身。
第一条路叫"基础模型改进"。这条路的核心思想是直接修改AI的神经网络参数——就是那些让AI"懂"语言、"会"思考的无数个数字。这就像把发动机拆开重新调校,改完之后AI本质上变了,它学到的新能力被永久写入了"基因"。这种方式改变根本、效果持久,但代价是时间长、计算成本高,而且一旦改错了,可能会把原来会的东西也弄忘了——就像发动机调试失败可能整辆车都跑不动了。
第二条路叫"脚手架改进"。这条路不动发动机,只改造"车身"。AI的核心大脑保持不变,但它的指令系统、记忆系统、工具箱、行动逻辑这些围绕它的东西会持续更新和优化。这就像给汽车加装更好的导航仪、换更大的油箱、升级刹车系统——发动机没变,但整辆车的表现大幅提升。这种方式快速灵活,出了问题容易撤回,就像导航仪设置错了直接重置就好,不影响发动机。
这两条路各有优劣,在实际系统中往往是搭配使用的。这篇综述的大部分内容,就是对这两条路上具体走法的详细梳理。
三、第一条路:直接给AI的"大脑"做手术
研究团队把基础模型改进的方法进一步分成了三个子类别,分别对应三种不同的"手术方式"。
第一种子类别叫"内生生成演示",用更通俗的话说就是"AI自己给自己出题做练习"。你可能觉得奇怪——一个AI怎么能给自己出有价值的题目呢?它不是本来就知道的东西吗?
这里的关键在于,现代大型语言模型在预训练阶段已经积累了海量知识,它完全可以利用这些知识生成新的训练数据。比如说,一个医疗AI可以根据它已知的医学知识,自动生成大量问答对:"如果患者出现这些症状,应该考虑哪些诊断?"然后用这些自己生成的数据来进一步训练自己,填补知识盲区。这个过程就像一个学生在考试前自己出模拟题来练习,而不是等着老师发练习册。
这套方法的核心挑战在于"质量控制"。AI生成的数据不一定全对,如果把错误的数据也用来训练自己,那就相当于做了一本错题集当成答案来学,越学越偏。研究团队梳理了多种质量控制手段——有的系统用"多数投票"原则筛选数据(多个AI独立作答,选择大家都认同的答案);有的用外部验证器来审核(比如让代码在真实环境中运行,通过测试才算对);还有的系统在生成新数据时会刻意保留一部分原始数据,防止AI越学越偏、忘掉根本。
其中一个特别有趣的发现来自研究者们观察到的"模型崩溃"风险:如果AI一直在自己生成的数据上反复训练,就像一台复印机不断复印自己的复印件,最终得到的东西会失真甚至变得面目全非。避免这一问题需要引入多样性机制,确保每次生成的数据都有足够的新鲜感。
第二种子类别叫"内生评估反馈",这回AI不光自己出题,还自己当老师批改作业。系统会让AI对自己的多个答案进行评分、排名或者批评,然后用这种自我判断来指导参数的更新。
举个具体的场景:一个写作AI生成了三种不同风格的文章,然后它自己担任评委,根据一套标准(比如是否符合用户的语气要求、逻辑是否连贯、有没有事实错误)给这三篇打分,选出最好的,并分析差的差在哪里,然后把这些判断转化成训练信号,让自己下次写得更好。
这类方法有三个具体的变体,分别对应三种批改方式。"标准反馈"就是让AI对照明确的评分标准打分,就像有答案的客观题;"一致性反馈"则是让AI多次回答同一个问题,用答案是否自相矛盾来判断好坏,自相矛盾的说明AI自己也不确定,可靠性低;"纠错反馈"是最精细的,AI不光给出对错判断,还要说明错在哪里、应该怎么改,这就像有详细批注的主观题批改。这三种方式各有适用场景,标准反馈适合有明确对错的领域,一致性反馈适合没有标准答案的开放问题,纠错反馈则最适合需要深度推理的任务。
第三种子类别叫"外生探索经验",这是最接近人类"在实践中学习"的方式。AI不再只是在自己的头脑里打转,而是真正去和外部环境互动——运行代码、浏览网页、操作界面、在游戏中对战——然后用这些真实交互产生的反馈来改进自己的参数。
研究团队把"外部环境"进一步分成两类。第一类是真实任务环境,比如让AI真正去解决GitHub上的编程问题、在真实浏览器里完成网页任务,用单元测试通不通过、任务完不完成来判断成败。这种反馈非常真实可靠,但成本高、速度慢,而且有些失败是不可逆的。第二类是模拟代理环境,研究者们专门训练一个"世界模型"来模拟真实环境,让AI在这个虚拟沙盒里先练习,再把有价值的经验迁移到真实任务中。这就像飞行员先在模拟驾驶舱里练习,再上真正的飞机。这种方式大幅降低了试错成本,但虚拟世界和真实世界之间总会有差距,这个差距本身就是一个需要认真管理的问题。
四、第二条路:不换发动机,只升级车身配件
脚手架改进这条路更加快速和灵活,研究团队把它分成了四个层次,从最小的局部调整到最彻底的整体重构。
最基础的层次是"提示词优化"——改变给AI的指令。这听起来很简单,但实际上是一门相当精深的学问。提示词就像你给一个聪明员工布置任务时说的话,说法不同,结果天差地别。同样的任务,用不同的方式表述,AI的表现可以从勉强及格跳跃到接近满分。
研究团队梳理了四种提示词自动优化的思路,每种思路背后的逻辑都很不一样。第一种叫"标量反馈优化",原理最直接:试很多不同的提示词表达,记录每种表达得到的任务完成分数,选得分最高的。就像盲目试菜谱,试够了自然找到最好的那个。
第二种叫"定性反馈精炼",比上面聪明得多。AI不只是知道哪个提示词得分高,还会生成一段文字说明"这个提示词为什么差、怎么改进"。然后把这段批评当做修改意见,对提示词进行有针对性的调整。就像厨师试菜之后不只是打分,还写下"这道菜太咸了,下次减盐三克",然后据此改菜谱。
第三种叫"种群进化法",借鉴了生物进化的思想。你准备一批不同版本的提示词(这是"种群"),让它们分别去完成任务,选出表现好的,让好的提示词之间相互"杂交"和"变异",产生下一代提示词,如此循环,提示词会像物种一样不断演化变强。一个有意思的系统甚至让AI自己进化"如何变异提示词"的规则,实现了"改进方法的方法"也在改进。
第四种最为精妙,叫"文字梯度优化",直接借鉴了数学中"梯度下降"的思想——数学里的梯度告诉你参数应该往哪个方向调整才能让函数值变小,这里的"文字梯度"则是一段文字,告诉你提示词应该往哪个方向修改才能让任务表现变好。这本质上是把深度学习的训练逻辑搬到了文字层面,非常有创意。
第二个层次是"记忆系统进化"。AI的记忆系统决定了它能记住什么、怎么记、什么时候回忆起什么。研究团队把记忆分成了三个维度来分析:记忆存什么、记忆怎么组织、以及记忆怎么被读写更新。
在"存什么"的问题上,研究者区分了两大类。一类是明文存储,就是把信息以人类可读的文字形式存起来,比如"用户喜欢简洁的回答"、"上次任务失败的原因是忘记了考虑时区差异"——这种记忆透明可查,出了问题很好发现和修正。另一类是隐式存储,把信息压缩成AI内部的数学向量,检索速度极快,但人类看不懂里面存了什么,一旦出问题很难排查。
在"怎么组织"的问题上,研究者梳理了四种主要架构。最简单的是线性记忆,按时间顺序把所有经历排成一列,就像日记本,容易写但很难在海量记录里找到需要的内容。更复杂的是层次化记忆,把记忆按重要性分层:高层存宏观摘要,低层存细节,就像百科全书里先有目录再有章节再有具体内容。图状记忆则把不同记忆之间的关系也存起来——"A事件导致了B事件"、"C人物和D人物认识"——这让AI在推理涉及多个关联信息的问题时大幅提升。向量检索记忆是目前最流行的工程方案,把所有记忆转成向量并建立索引,通过计算向量相似度来快速找到最相关的记忆,就像给所有书籍都贴上了代表其内容的数字条码,查询时用条码匹配而非逐本翻阅。
在"怎么读写更新"的问题上,研究者总结出了记忆系统应该具备的四种基本操作:创建(什么时候把新信息写入记忆)、读取(怎么找到最有用的记忆)、更新(已有记忆过时了怎么修正)、删除(不再有用的记忆怎么清理)。这四个操作的设计质量直接决定了记忆系统的好坏,设计不当会导致记忆越积越乱、检索越来越慢、或者关键信息被错误删除。
第三个层次是"工具治理",这涉及AI如何管理自己能用的工具箱。研究团队把工具管理的能力分成了三个层级,形成一个递进关系。
最基础的能力是"动态工具路由"——当面对一个任务时,AI能从众多可用工具中准确选出最合适的那几个,并按正确顺序调用。这就像一个经验丰富的厨师面对一道复杂菜肴,知道应该先用什么刀、再用什么锅、然后用什么调料,而不是随机抓工具用。研究发现,随着工具数量增多(现代AI系统可能有成百上千个可用工具),路由准确性会显著下降,因此许多系统开始用图状结构来表示工具之间的依赖关系,而不是简单地把工具一股脑儿丢给AI自己选。
更高一层的能力是"迭代工具精炼"——当一个工具运行出了错误,AI能自动诊断问题并修改工具代码,直到它能正确运行为止。这就像一个技工发现扳手用起来别扭,自己把扳手的手柄重新设计了一下。研究者发现,工具失败的原因很多时候不是工具本身的代码有错,而是AI对工具的使用说明理解有偏差,所以有些系统专门优化工具的文档描述,而不是优化工具本身。
最高层的能力是"自主工具创造"——当现有工具都不够用时,AI能凭空写出一个新工具来。这就像厨师发现厨房里没有合适的工具来完成一道新菜,于是自己设计并制作了一把专用刀具。研究者发现,这项能力的难点不在于写代码本身,而在于把新工具无缝集成进现有的工具管理系统,确保它能被正确调用、不与其他工具产生冲突。
第四个层次是"全脚手架更新",这是最彻底也最接近真正"递归自我改进"的方式。在这个层次上,AI不只是改某个配件,而是把自己整套运行逻辑、源代码和架构都当成可以修改的对象,自己对自己进行系统级的重构。
研究团队介绍了几个代表性的系统。"达尔文哥德尔机器"从一个最初版本的AI编程代理出发,不断重写自己的代码,每次重写后在编程基准测试上进行验证,只有通过测试的新版本才会被保留,最终形成一棵不断分叉的"进化树",树上的每个分支都是某种特化能力的后代。"GPT群"把整个多智能体系统表示成一个可以被优化的图,AI们不只是使用这个图,还能修改图的结构本身。"自学优化器"把一个AI程序看作一个"改进器"——给它自己的源代码和一个衡量好坏的函数,它会不断查询语言模型生成候选改进版本,选择分数最高的版本,如此反复,形成递归自我改进的闭环。
研究团队特别提到,这类方法在理论上拥有无限的改进空间(因为程序是图灵完备的),但在实践中必须配以严格的验证门控——每次改进前后都要跑完整的测试套件,只有确认新版本比旧版本更好且没有引入新问题,更新才会被接受。否则,一个自我修改的AI系统可能在几次迭代后就变得面目全非,甚至彻底失去原本的能力。
五、这些技术都用在哪里?六个真实应用场景的深度观察
理论固然重要,但研究团队花了大量篇幅分析这些技术在六个具体领域的实际应用,每个领域都有独特的反馈特性和主要挑战。
软件工程领域是目前AI自我改进研究最成熟的战场。原因很简单:代码的好坏有非常明确的判断标准——单元测试通不通过,程序能不能运行,功能对不对。这种"可执行检验"让AI能够快速、自动地获得高质量反馈,形成闭环。SWE-bench这个基准测试平台提供了真实GitHub仓库里的软件问题,让研究者能够系统地衡量AI在真实软件工程任务上的进步。研究者们发现,在这个领域里,脚手架改进(尤其是工具使用和记忆系统的优化)和基础模型改进(用代码执行结果来做强化学习)都能带来显著提升,但两者结合效果最好。一个独特的挑战是:AI解决的那些问题,有时候并不是真正"理解"了,而是找到了特定测试用例的"作弊"方式,所以评估需要用AI没见过的新问题来验证真实泛化能力。
网页导航与自动化领域有完全不同的挑战。网页界面随时在变化,同样的任务今天能完成,明天页面改版了可能就失败了。更麻烦的是,一个长序列网页操作任务往往要到最后一步才知道成不成功,中间过程的对错很难判断。研究团队介绍的WebRL系统采用了一个聪明的方案:让AI自己从失败案例中提取新任务,并训练一个专门的成功判断模型来评价每条操作轨迹,两者协同进化。安全性在这个领域是一个严肃的问题,因为网页上的恶意内容可能通过"提示词注入"攻击劫持AI的行为,让它做出违背用户意图的事情。
游戏与策略推理是AI自我改进研究最历史悠久的领域,从AlphaGo开始就广为人知。在这个领域,AI可以通过自我对弈产生无限量的训练数据,环境是封闭可控的,反馈是即时清晰的。研究团队分析的案例包括在外交谈判类游戏、狼人杀社交推理游戏等复杂多智能体场景中的应用。一个有趣的发现是:在多智能体游戏中,AI的"改进"并不总是单调递增的,它可能随着对手策略的变化而出现性能波动,即使绝对实力在增强,对特定对手的胜率也可能忽高忽低。这意味着评估游戏AI不能只看它对固定对手的成绩,而需要评估它在各种对手策略下的综合表现。
科学发现是最让人兴奋也最充满争议的应用领域。一系列被称为"AI科学家"的系统已经能够自动提出研究假设、设计实验方案、运行代码分析数据、撰写论文草稿,并根据同行评审式的反馈迭代改进。研究团队特别指出这个领域的三大挑战:首先,科学发现的质量很难自动验证,"新颖性"、"正确性"、"可重现性"都需要人类专家判断;其次,不同科学领域的工具和数据格式差异极大,一个通用AI很难无缝切换;第三,AI可能在没有充分证据的情况下自信满满地生成看似合理但实则错误的假设,这种"幻觉式发现"如果被当做真正的科学进步,后果可能相当严重。
具身AI与机器人领域面临的是完全不同的物理世界挑战。机器人不能随意试错,因为真实世界的错误可能损坏设备甚至造成安全事故;传感器数据有噪声,真实物理动力学无法完全用模型预测;而且在仿真环境中训练好的机器人,搬到真实硬件上常常表现大打折扣。研究团队介绍的RoboCat系统采用"数据飞轮"策略:先训练一个基础机器人策略,让它去执行任务并收集更多数据,用这些数据再训练更强的策略,如此循环,不断提升真实世界操控能力。
通用计算机控制是最接近普通人日常软件使用场景的领域:让AI像人一样使用操作系统、打开各种应用软件、完成复杂的跨软件任务。研究团队建立的OSWorld平台提供了标准化的虚拟桌面评测环境。这个领域的主要挑战是应用软件种类繁多,每个软件都有独特的界面逻辑,AI必须能够快速适应从未见过的新软件。研究发现,基于记忆的层次化规划和课程学习(从简单到复杂逐步增加任务难度)对提升这类泛化能力特别有效。
六、怎么衡量AI到底有没有真正"进步"?评估的学问比你想象的难得多
研究团队在这一部分揭示了一个常被忽视但极为重要的问题:很多AI自我改进研究声称的"进步",其实可能只是在刷分,而不是真正的能力提升。
一个严格的AI自我改进评估应该满足几个条件。首先,必须报告完整的学习曲线,而不是只报告最高峰值——因为一个好的自我改进系统应该是持续稳定地进步,而不是在某次迭代侥幸刷出高分。其次,必须在训练过程没有用过的全新任务上测试泛化能力——如果AI只是记住了训练题目的答案,那叫记忆,不叫学会。第三,必须明确报告改进过程中消耗了多少计算资源、时间成本和人工干预——一个需要大量人工维护的"自我改进"系统,其实并没有那么"自我"。第四,必须追踪是否出现"改进回归"——也就是AI在某些原来会的任务上因为自我改进而变差了,这种情况在实践中相当常见但常常被报告所忽略。
评估方式本身也分两大类。一类叫"指标评估",使用程序可自动核验的客观标准——代码测试通不通过、网页任务有没有完成、机器人有没有抓到物体。这类评估可靠、高效、可重复,但只适用于有明确对错的任务。另一类叫"裁判评估",用另一个AI来判断第一个AI做得好不好,这让AI评估扩展到了开放性任务。但这里有一个微妙的危险:如果用来训练AI的反馈信号和用来评估AI的裁判是同一个系统,AI可能会学会"取悦裁判"而不是真正做好任务,这就像学生学会了猜老师喜好来答题,而不是真正理解知识。
七、设计一个真正可用的AI自我改进系统:三条核心原则
综述的最后部分,研究团队基于所有梳理过的文献,提炼出了构建可靠的AI自我改进系统应当遵守的三条原则。
第一条原则是"快与慢的协同"。脚手架改进快、灵活、成本低,是日常迭代的主力;基础模型改进慢、稳定、能力强,是积累长期能力的途径。好的系统设计应该让这两条路互补:先通过脚手架改进发现有效的新策略,在多次迭代验证稳定后,再通过模型训练把这些策略内化进基础模型,形成永久能力。这就像一名厨师先在日记本上记录新食谱、反复试验修改(快速脚手架迭代),等食谱成熟了再把它背下来(参数内化),下次做这道菜时就不需要翻笔记了。
第二条原则是"批评者必须保持独立"。在任何自我改进循环中,用来评判好坏的"批评者"绝对不能与被改进的系统完全混为一谈。一旦AI学会了如何操纵自己的评判者,整个自我改进机制就会崩溃——AI会找到让自己看起来表现好但实际上什么都没学到的捷径,就像一个学生同时是出卷老师和阅卷老师,必然会给自己开绿灯。实践中,这意味着评估系统应该经常轮换、使用不同能力和风格的模型来做交叉验证,并且定期引入人工审核作为最终校准。
第三条原则是"安全必须分层设防"。随着AI自我改进能力增强,它能做的事情越来越多,潜在的风险也越来越大。研究团队特别警告:当AI能够修改自己的工具代码、运行逻辑甚至整套系统架构时,一个微小的错误可能通过连锁反应造成严重的系统性问题——就像一辆能给自己换零件的汽车,如果换错了刹车零件,后果不堪设想。因此,每一次系统更新之前都必须通过一套验证检查,包括功能正确性测试、权限边界检查和随机扰动测试,确保改进后的系统比改进前更好而不是更差。
归根结底,这篇综述告诉我们的是:AI系统自我改进不是一件"设好了让它跑"就能放手不管的事情,而是一个需要精心设计、严格监控、持续审计的工程系统。好的自我改进AI就像一家设计良好的公司:有清晰的岗位分工,有内部审计机制,有明确的权限边界,出了问题能够快速定位和回滚,而不是一团乱麻地"进化"。
那么,这对我们普通人意味着什么?说到底,这篇综述的意义在于它为整个领域提供了一张清晰的现状地图和前进路线图。短期内,自我改进的AI系统会让软件工程助手、科学研究工具、网页自动化助理变得越来越强大,因为这些领域已经有了相对成熟的自动验证机制。中长期内,这套技术框架将逐渐扩展到更多领域,让AI助手真正能够从与你的每一次互动中学习,而不是用同样的方式重复犯错。
有兴趣深入了解的读者,可以通过arXiv论文编号2607.13104查阅这篇综述的完整版本,那里收录了从2023年到2026年间数百篇相关研究的详细对比和分析。
Q&A
Q1:AI自我改进中的"脚手架"是什么意思?
A:脚手架指的是围绕AI大脑(基础模型)的辅助系统,包括给AI的指令(提示词)、AI使用的记忆系统、AI能调用的工具(如搜索引擎或代码执行器),以及控制AI行动逻辑的规则。脚手架改进就是在不修改AI核心参数的情况下,通过升级这些辅助系统来提升AI表现,相当于只改装车身而不换发动机。
Q2:AI自我改进会不会让AI变得不受控制?
A:这是研究者们非常重视的安全问题。论文指出,当AI能修改自己的运行逻辑甚至代码时,风险会显著增加。为此,研究团队建议所有自我改进系统都必须配备严格的验证机制——每次修改之前都要通过功能测试和权限边界检查,人类监督也不能缺席。自我改进的边界必须明确设定,改进只能在预先规定的范围内发生。
Q3:AI自我改进技术目前在哪些领域应用最成熟?
A:目前最成熟的应用领域是软件工程,因为代码的对错可以用单元测试自动判断,反馈非常清晰。其次是网页导航自动化和游戏策略推理。科学发现领域虽然进展很快,但由于发现质量难以自动验证,仍然高度依赖人类专家的判断。机器人领域受限于物理世界试错成本高的问题,进展相对较慢。
好文章,需要你的鼓励
ARCHead是一种专门压缩大语言模型输出层的方法,通过量化低秩核心与激活度量修正,将LM-head存储压缩至BF16的约25%,质量损失极小。
这项研究发现AI投票推理在多答案问题上会系统性失效,提出用因果数学规则直接验证候选答案的CALVER方法,准确率比投票提升约11至19个百分点,且差距随尝试次数持续扩大。
这项来自港科大与腾讯视频的研究提出WorldCycle框架,通过可逆动作循环构造无标注自验证奖励,将视频世界模型的长程漂移误差降低最高44%,复合动作准确率提升约四倍。
哥本哈根大学团队构建了首个同时覆盖三种引用粒度、屏蔽信息泄露、包含全量段落候选库的法律信息检索数据集LegalPincite,用于评估法律判决段落精确检索任务。