微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 上海人工智能实验室造出了一个会自我进化的AI科学家,它用12小时干了别人24小时都没做完的事

上海人工智能实验室造出了一个会自我进化的AI科学家,它用12小时干了别人24小时都没做完的事

2026-06-11 09:46
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-11 09:46 科技行者

这项由上海人工智能实验室与华东师范大学联合开展的研究,于2026年6月发表在预印本平台arXiv,编号为arXiv:2606.06473。感兴趣的读者可通过该编号查阅完整论文原文。

假设你是一名参加数学竞赛的学生,每次做完一道题,你都把自己的解题思路、哪里走了弯路、什么方法最终奏效,全部记在一个专属笔记本里。做下一道题时,你会先翻翻这个笔记本,避开之前踩过的坑,复用之前成功的技巧。与此同时,你不是一个人在孤军奋战——你有几个同伴在平行地尝试不同的解法,当你自己卡住的时候,你可以偷看他们的草稿,甚至在大家都卡住的时候,把所有人的思路汇总起来,开创一条全新的解题路线。

这正是上海人工智能实验室研发的MLEvolve系统的核心逻辑。它是一个由大型语言模型(也就是ChatGPT这类AI的底层技术)驱动的多智能体框架,专门用来自动完成机器学习工程任务——通俗地说,就是让AI自己设计、编写、测试和优化用于数据分析或图像识别等任务的程序代码,全程不需要人类干预。

一、当AI遇上"编程马拉松":机器学习工程到底有多难

机器学习工程,听起来高深莫测,其实背后的逻辑和厨师研发新菜谱很像。厨师需要反复试验食材搭配、火候控制、调味比例,每一次试验都可能失败,但每一次失败都能积累经验。机器学习工程师做的事情也差不多:他们要处理原始数据(准备食材),选择合适的模型(选择烹饪方法),调整训练参数(调节火候),最后得到一个能准确预测结果的程序(端上桌的成品菜肴)。

问题在于,这个过程极其耗时且依赖经验。一个有经验的工程师可能需要好几天才能在某项竞赛中交出一份有竞争力的方案。这就催生了一个自然的想法:能不能让AI来替代人类完成这整套流程?

近年来出现了一类专门为此设计的系统,业内称之为"MLE智能体"(机器学习工程智能体)。这类系统让AI自动规划方案、生成代码、运行程序、根据结果调整策略,一轮一轮地迭代,就像一个不需要休息的自动化工程师团队。OpenAI专门设计了一个名为MLE-Bench的评测基准,包含75道来自Kaggle数据科学竞赛平台的真实题目,用来衡量这类系统的能力高低。

然而,现有的MLE智能体普遍存在三个让人头疼的问题。第一个问题可以叫做"信息孤岛":当AI沿着多条思路同时探索时,每条路线之间互相不通信,一条路线发现了好用的技巧,另一条路线完全不知道。第二个问题是"金鱼记忆":每次做决策时,AI不会去回忆之前哪些方法失败过、哪些方法成功过,每次都像是从零开始思考。第三个问题是"一刀切生成":AI在每次迭代时都把整个程序从头重写一遍,既浪费时间,又容易把之前已经调试好的部分搞坏。

MLEvolve就是为了彻底解决这三个问题而生的。

二、探索地图从"树"变成"网":渐进式蒙特卡洛图搜索

在解释MLEvolve的核心创新之前,先来理解一下现有方法是怎么工作的。大多数MLE智能体使用的是"蒙特卡洛树搜索",可以把它想象成一棵不断生长的决策树。根节点是最初的解决方案,每次AI做出一个改动,就从当前节点生长出一个新的子节点。树上的每条从根到叶的路径,代表一系列连续的改进尝试。这种结构清晰直观,问题在于,树的不同分支之间是完全隔绝的——左边的分支发现了一个绝妙的技巧,右边的分支永远不知道。

MLEvolve把这棵树升级成了一张网,也就是图结构。除了普通的父子连接边之外,它还引入了一种叫做"参考边"的连接方式,专门用来在不同分支之间架桥。这张网就是"蒙特卡洛图搜索"(MCGS)的核心数据结构。

在这张网上,AI探索时有四种不同的行动模式,都基于一套统一的数学公式。

第一种是最基础的模式:从当前节点出发,只参考父节点的信息,生成一个新的改进方案。这和传统的树搜索没有区别,是其他三种模式的基础。

第二种叫做"分支内进化":当AI在某条分支上连续尝试了好几次都没什么进展时,它会回头审视这条分支上最近几步的历史记录,分析哪些改动带来了提升、哪些改动导致了退步,然后据此制定一个更有针对性的新方案。这就像那位比赛学生翻看自己的错题本,从自身的失败中学习,而不是盲目地继续碰壁。

第三种叫做"跨分支参考":当一条分支长时间没有进步(用一个专门的指标来衡量是否"停滞不前"),AI会从其他所有分支中挑选出表现最好的几个方案,把它们的代码和思路作为参考,注入到当前分支的下一次改动中。这就像竞赛学生在自己卡壳时,偷看一眼同伴草稿纸上的精彩解法,获得灵感。

第四种叫做"多分支聚合":当整个系统的全局最佳成绩长时间没有改善(意味着所有分支都遇到了瓶颈),系统会把来自多个不同分支的最优思路汇总在一起,从根节点出发,开辟一条全新的探索分支。这类似于竞赛团队开会,把每个人发现的最好方法拼接起来,尝试一种全新的综合方案。

除了这四种探索模式,MLEvolve还有一个巧妙的"进度感知"机制,数学上受到信息熵的启发。在探索的早期阶段,系统会广撒网,鼓励多样化地探索不同方向;随着时间推移,当某些方向已经显现出明显优势时,系统会逐渐把更多计算资源集中到这些更有希望的方向上,减少在低价值分支上的无谓消耗。具体来说,系统维护一个"精英节点池",记录全局表现最好的若干方案,在探索的后期阶段,系统会以越来越高的概率直接从这个精英池中选取起点继续深化,而不是按照常规的树遍历方式去选节点。

研究团队用一个直观的数据验证了这一机制的有效性:在探索初期,系统同时活跃推进的分支数量大约是4.8条;到了探索后期,这个数字收缩到了约2.8条,说明计算资源确实集中到了更有价值的方向上。相比之下,传统的固定策略树搜索全程都保持在约4.3条活跃分支,无论优劣一律平等对待,造成大量资源浪费。

三、专属记忆笔记本:回顾性记忆系统

解决了"信息孤岛"的问题之后,MLEvolve转向第二个挑战:让AI拥有真正有用的记忆,而不是每次决策都从零开始思考。

回顾性记忆系统由两部分组成,功能上相当于两种不同类型的笔记本。

第一种是"冷启动知识库",相当于一本事先编写好的参考手册。研究团队根据不同类型的机器学习任务(比如图像分类、自然语言处理、表格数据预测等),整理了一份推荐的模型清单和使用指南,信息来源于开源社区和竞赛平台上的实战经验。当AI接到一个新任务时,它会先根据任务类型查阅这本手册,获取领域内被证明有效的模型选择建议,避免一开始就走偏。这解决了"冷启动失误"的问题——即使是经验丰富的AI,在面对陌生任务类型时,如果没有任何先验知识,第一步往往会选择一些不合适的方法。

第二种是"动态全局记忆",相当于一本在实战中实时更新的日记本。每当AI成功运行完一段代码并得到评估结果,系统就会自动把这次尝试的规划思路、代码实现、得分结果和经验分析,一并记录到这个动态记忆库中。这些记录会在两个关键时刻被检索和利用。

其一是规划阶段:AI在生成初步方案之后、正式写代码之前,会用自己的初步方案作为关键词,去记忆库中搜索相似的历史经验,找出哪些方向曾经带来过提升、哪些方向曾经以失败告终,然后据此调整和细化方案。其二是调试阶段:当代码运行出错时,AI会用错误信息作为关键词去搜索记忆库,看看之前有没有遇到过类似的错误以及是如何解决的,从而快速定位问题。

检索方式采用了两种技术的组合:一种是关键词匹配(类似于用词语在文档中搜索),另一种是语义相似度搜索(类似于找"意思接近"的内容,即使用词不同)。两种搜索结果通过一种叫做"倒数排名融合"的算法综合排序,确保检索出来的历史经验既包含字面相关的,也包含语义相关的。

这套记忆系统最大的优点是完全自动化——它不需要额外调用AI模型来"总结经验"或"生成洞察",所有记录都是原始的执行数据,检索和利用的过程也是程序化完成的,省去了额外的计算开销。

四、让"想法"和"动手"分开:层次化规划与自适应代码生成

第三个挑战是解决"一刀切重写"的问题。MLEvolve引入了一套将战略规划与代码实现分离的层次化机制,用两个专门的角色来承担这两项工作。

"规划者"负责思考"该改什么"和"为什么要改"。它在较高的抽象层次上工作,分析当前程序在数据预处理、模型设计、训练策略、评估方式等各个模块上分别存在什么问题,然后产出一份结构化的改进计划,明确指定需要修改哪些模块以及修改的逻辑依据。

"编码者"则负责具体落实"如何改"。它接收规划者产出的改进计划,聚焦于代码层面的实现,在不破坏已有可用代码的前提下,针对性地实施改动。

编码者在执行时会根据当前任务的状态,在三种不同的代码生成模式中选择最合适的一种。当还没有任何可用的基础代码时,采用"全量编写"模式,从头生成完整的解决方案。当面对一个结构复杂、需要多个处理阶段的任务时,采用"逐模块编写"模式,按照规划者划定的模块边界逐块生成,降低一次性生成长代码的难度。当已经有一个基本能跑的方案,只需要针对性地优化某些部分时,采用"差异补丁"模式,只生成需要改动的代码片段,像打补丁一样精准地插入原有代码,最大限度地保留已有的正常功能。

每一次代码生成完毕之后,还有两个专门的"质检智能体"进行把关:代码审查智能体检查命名错误、缺失的导入库、可疑的代码模式,以及评估指标计算是否正确;数据泄露检测智能体则检查训练数据和验证数据之间是否存在不当的交叉,以防止AI因为"看了答案"而产生虚假的高分。

五、整体协作架构:九个专家智能体的团队作战

MLEvolve的完整系统由九个专业化智能体共同构成,每个智能体负责整个流程的一个特定环节。

起草智能体在任务开始时生成初始方案,负责查阅冷启动知识库并产出第一版代码。改进智能体在有了基础可运行方案之后接手,负责在规划者的指导下通过差异补丁模式持续优化。调试智能体专门处理程序崩溃或报错的情况,负责根据错误信息快速定位和修复问题,尽量少改动已经正常工作的部分。进化智能体对应"分支内进化"操作,它汇总同一分支的近期历史,从过去的成败经验中提炼出新的改进方向。融合智能体对应"跨分支参考"操作,在本支路停滞时引入其他分支的优秀方案作为参考。聚合智能体对应"多分支聚合"操作,在全局停滞时把多条分支的最佳成果汇合成一个全新起点。代码审查智能体承担质量把关工作,检查每次代码生成的合规性。数据泄露检测智能体防止评估指标虚高。结果解析智能体负责解读程序运行输出,提取评分指标和关键信息,将结构化的反馈信号送回搜索循环。

每次迭代的流程大致是:系统根据搜索状态选择适当的智能体,智能体先从记忆库中检索历史经验,再由规划者产出改进计划,再由编码者实现代码,经过审查智能体把关后执行,执行结果反馈给搜索图并写入记忆库,然后开始下一轮迭代。

六、跑分结果:在一半时间内超越了所有对手

研究团队在MLE-Bench的全部75道题目上对MLEvolve进行了测评,并与市面上所有已发表的主流MLE智能体系统进行了对比。

MLEvolve在12小时的时间限制下,取得了65.3%的平均奖牌率。奖牌率的含义是:在所有题目中,有多少比例的题目达到了Kaggle竞赛中铜牌、银牌或金牌的标准——也就是打败了相应比例的人类参赛者。具体来看,在难度较低的22道题目上,奖牌率达到了80.3%;在中等难度的38道题目上达到了64.0%;在高难度的15道题目上达到了46.7%。其中金牌率(只算获得金牌的题目)为34.7%,有效提交率(所有题目都成功生成了格式正确的结果文件)达到了100%,超越人类参赛者中位线的比率为76.0%。

这个成绩的意义在于,MLEvolve只用了12小时,而其他竞争系统普遍需要24小时的时间预算。在同样的24小时条件下,此前排名最高的系统AIBuildAI获得了63.1%的总体奖牌率,MARS+获得了62.7%,MLEvolve在一半的时间内就超过了这两者。

时间维度上的表现同样能说明问题:从搜索开始到12小时结束,MLEvolve在测试题目上的"战胜率"(即胜过多少比例的人类参赛者)从最初持续快速攀升,到12小时结束时达到了98.2%。相比之下,传统的固定策略树搜索在大约中途就开始停滞不前,最终只到达了约70.7%的战胜率。MLEvolve的曲线一直保持向上的趋势,说明它在长时间运行的后期阶段依然有实质性的进步,而不是过了某个点就陷入原地踏步。

七、跨领域测试:去数学竞赛也能拿冠军

为了验证MLEvolve的能力不只局限于机器学习工程这一个领域,研究团队把它放到了一套完全不同的任务上:来自AlphaEvolve(谷歌DeepMind的算法发现系统)的15道数学算法优化问题。这些题目和机器学习工程毫无关系,考验的是纯数学优化能力,比如在正六边形中尽可能多地填充小圆、寻找使某个不等式取极值的特定配置等。

MLEvolve在这15道题中的11道上取得了所有对比方法中的最佳成绩,超越了专门为算法发现设计的AlphaEvolve、AlphaEvolve-v2、SimpleTES、TTT-Discover和OpenEvolve等系统。这一结果表明,MLEvolve的自我进化机制并不是针对机器学习工程量身定制的特殊技巧,而是一种具有普遍性的迭代优化框架,只要任务的本质是"反复尝试、评估结果、调整方案",这套机制就能发挥作用。

八、拆解验证:每个零件都不是多余的

为了确认系统的每个设计都真正有效,研究团队在MLE-Bench的22道精选题目上进行了消融实验,每次移除一个核心组件,观察性能的变化。

去掉渐进式蒙特卡洛图搜索之后,系统退化为固定策略的普通树搜索,奖牌率从81.82%下降至68.18%,战胜率从88.39%下降至79.91%,跌幅最大。这说明图搜索和进度感知机制是性能提升的最主要驱动力。

去掉回顾性记忆系统之后,奖牌率同样下降至68.18%,战胜率降至81.90%。系统仍然可以通过纯粹的搜索偶尔找到好方案,但缺少经验积累和反馈指导,在需要长时间迭代的任务中明显乏力。

去掉自适应代码生成(回退到每次都从头重写整个程序的模式)之后,奖牌率降至72.73%,战胜率降至84.14%。规划者与编码者的分离、以及差异补丁模式的缺失,使得代码迭代的稳定性明显下降。

研究团队还进一步拆解了渐进式图搜索和回顾性记忆系统内部的各个子机制。结果发现,在图搜索的几种操作中,"分支内进化"(让AI复盘自己的历史失败)影响最为关键——单独去掉它之后,奖牌率从66.67%骤降至33.33%,足足减半。跨分支参考和精英引导的深度利用也有贡献,但相对较小,它们更多地影响的是解决方案的质量上限,而不是能否达到奖牌线。在记忆系统方面,冷启动知识库和动态全局记忆各自都有贡献,单独去掉任意一个都会把奖牌率拉低到44.44%,但去掉动态全局记忆对最终得分质量的影响更深,说明实战积累的经验比预设的领域知识更具长期价值。

九、换一颗"大脑"也照样好用:跨模型兼容性测试

现实中,AI语言模型有很多不同的版本和来源,一个好的框架不应该对某一个特定的模型产生强依赖。研究团队测试了四种不同的语言模型作为MLEvolve的"大脑":Gemini-3.1-Pro-preview、GPT-5.5、DeepSeek-v4-Pro和Kimi-K2.6,在图像分类、自然语言处理和音频识别三类典型任务上对比了各自的表现。

结果显示,四种模型在不同任务类型上各有所长。GPT-5.5在自然语言处理类任务上表现最突出,战胜率达到96.2%;Kimi-K2.6在音频任务上领先,战胜率高达99.2%;Gemini-3.1-Pro-preview和DeepSeek-v4-Pro在图像任务上有各自的优势。尽管各有侧重,四种模型在MLEvolve框架下都取得了有竞争力的结果,没有任何一种模型出现明显的失常表现。这说明MLEvolve的框架设计是通用的,对语言模型的依赖度较低,不同来源、不同能力侧重的模型都能从中获益。

说到底,MLEvolve做的事情可以用一句话概括:它让AI真正像一个会积累经验、善于协作、懂得把时间花在刀刃上的高手,而不是一个只会无头苍蝇式反复试错的机器。三个关键设计——让搜索从孤立的树变成互联的网、让AI有一本能随时翻阅的经验日记、让"想什么"和"怎么做"这两件事分开交给专人负责——每一个设计单独看都有意义,组合在一起则产生了乘法效应。

这对普通人的意义或许在于,这类系统若继续发展成熟,未来可能让"做一个数据分析项目"或"开发一个预测模型"这样的事情,不再需要花数周时间、雇用昂贵的专业工程师,而是可以像委托一个高效的助手一样,描述清楚目标,让系统自己去迭代完成。当然,这距离随手可用的消费级产品还有相当距离,但方向已经相当清晰。对这一方向感兴趣的读者,可以通过编号arXiv:2606.06473查阅完整的原始论文,代码也已开源,地址可在论文中找到。

Q&A

Q1:MLEvolve和普通的AI代码生成工具有什么本质区别?

A:普通的AI代码生成工具(比如GitHub Copilot)是一次性补全代码,不会自己运行、评估、再改进。MLEvolve是一个完整的自动化迭代系统,它能自己运行代码、看结果、分析哪里不好、制定改进方案、再写新代码,一轮一轮地循环,同时还会积累历史经验避免重蹈覆辙,这两者的工作模式有根本性的不同。

Q2:渐进式蒙特卡洛图搜索比普通蒙特卡洛树搜索好在哪儿?

A:普通蒙特卡洛树搜索的各条搜索分支之间完全隔绝,信息无法互通,而且全程用同一套固定策略,不知道把计算资源优先投入到有希望的方向。图搜索通过"参考边"打破了分支之间的信息壁垒,让成功经验可以跨分支流动;进度感知机制则让系统在早期广泛探索、后期聚焦于最有希望的方向,资源利用效率更高。

Q3:MLE-Bench的奖牌率65.3%是什么意思,能说明什么问题?

A:MLE-Bench包含75道来自Kaggle竞赛的真实题目,奖牌率65.3%的意思是MLEvolve在其中约49道题上达到了Kaggle金牌、银牌或铜牌的标准,即打败了相应比例的人类参赛者。这个成绩是在12小时时间限制下取得的,而此前所有对比系统都需要24小时才能达到更低的成绩,说明MLEvolve在速度和质量两个维度上同时领先于现有方法。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-