微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 当AI科学家集体"陷入近视":佐治亚理工等七所顶校联手破解科学假设探索的多样性困局

当AI科学家集体"陷入近视":佐治亚理工等七所顶校联手破解科学假设探索的多样性困局

2026-06-19 09:47
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-19 09:47 科技行者

这项由佐治亚理工学院、弗吉尼亚理工大学、卡内基梅隆大学、加州大学伯克利分校、剑桥大学和微软研究院新英格兰分部联合开展的研究,发表于2026年第43届国际机器学习大会(ICML 2026),会议地点为韩国首尔,论文编号为arXiv:2606.10587。

科学发现从来就不是一场赌注押在单张牌上的游戏。真实的科学探索更像是一场地毯式搜索行动——研究者们撒下一张大网,同时捕捞若干有价值的候选答案,再逐步筛选验证。然而,当人工智能被用来加速这一过程时,一个令人不安的模式开始浮现:AI系统往往会过早地把所有注意力集中到某一个"看起来最好"的答案上,就像一个搜救队员在找到第一个线索后便停止搜寻,而对其他可能同样重要的区域视而不见。

这支来自七所顶尖研究机构的团队正是为了解决这个问题而聚集在一起。他们提出了一个名为EvoDiverse的新框架,其核心思路借鉴自物理学中一种叫做"并行回火"的经典算法,通过在不同温度下同时运行多个搜索进程、并让这些进程之间进行有序的信息交换,来同时保持探索的广度和收敛的质量。实验结果覆盖了分子设计、方程发现和算法发现三个完全不同的领域,在相同的计算预算下,EvoDiverse生成的假设无论在质量还是多样性上均优于现有方法。

一、AI科学家为什么会"越走越窄"

要理解这个问题,不妨以一个选址团队为例。假设某公司要在一座城市里选择开店的最佳位置,团队派出了一批调研员,每个人负责评估不同街区。常规的做法是:每一轮结束后,把表现最差的街区淘汰掉,留下表现最好的几处继续深挖。这个策略短期内非常高效——资源被集中到了最有潜力的地方。

然而问题是,"当前评估最好"并不等于"最终最好"。也许某条看似平淡的街区,到了圣诞节客流量会暴增;也许两个中等街区各自有一半优点,如果综合起来反而是最优解。更危险的是,评估本身就可能不准确——用简化模型打分的街区,真实开业后的表现可能和预测大相径庭。

这正是当前AI假设搜索面临的困境。研究者们把这种现象称为"多样性崩塌":在一轮又一轮的竞争性筛选中,搜索群体越来越同质化,最终所有候选方案都挤在假设空间的一个小角落里。当后续验证(无论是昂贵的实验室实验还是耗时的计算机模拟)揭示这个角落并非最优时,整个搜索努力几乎付诸东流。

这个问题在科学发现中尤为突出,因为科学验证往往代价高昂、结果充满噪声。药物研发中,一个分子能否成功抑制某个蛋白质,必须经过耗资巨大的实验才能确认;物理定律的发现,需要在大量真实测量数据上反复检验。在这种情况下,研究者们从来不会只押注在单一候选方案上——他们需要一批质量相当、但结构各异的候选假设,以此对冲不确定性。

二、温度计的启示:物理学给AI出了道好题

在提出解决方案之前,研究团队首先对"为什么搜索会越走越窄"这个现象给出了一个数学框架上的解释。他们把AI的假设搜索过程类比为物理学中的一个经典问题:如何让一个粒子从一个高能状态降落到能量最低的状态?

在物理学里,这对应着所谓的"玻尔兹曼分布"。温度越高,粒子的行为越随机——它可以轻易地越过各种能量屏障,探索广阔的状态空间;温度越低,粒子就越倾向于稳稳地待在局部能量最低点。这与AI搜索的直觉完全对应:高温意味着更多探索、更愿意尝试"看起来不那么好"的方案;低温意味着更专注、更快速地收敛到当前最优解。

问题在于,单一温度无法两全其美。常见的做法是从高温开始,随时间降温——这就是所谓的"模拟退火"方法。但研究团队指出,在一个固定的计算预算内,这种方式的效果非常依赖于降温速度的设定,而且仍然容易陷入局部最优。

物理学家早就发现了这个问题,并提出了一个优雅的解法:并行回火算法,或者叫"平行调温"。核心思路是:不要只跑一个温度,而是同时跑多个不同温度的副本。高温副本负责广泛探索,低温副本负责精细收敛。最关键的是,这些副本不是各自为政——它们之间会定期互相"交换"候选方案,具体采用一种叫做"Metropolis-Hastings"的判断规则,确保交换是有意义的,而不是随机乱换。

这个规则的妙处在于:只有当来自高温群体的候选方案对低温群体也有合理价值时,交换才会发生。这样一来,高温群体发现的有价值的多样性候选方案可以"流入"低温群体加以精炼,而低温群体中陷入局部最优的候选方案也可以被"送回"高温群体重新激活探索。

三、EvoDiverse的工作原理:两个鱼池的协作

研究团队把这套物理学思路移植到大语言模型(LLM)驱动的科学假设搜索中,构建出EvoDiverse框架。整个系统的运作可以这样理解。

把候选假设的集合比作两个鱼池:一个是"冷水池",一个是"热水池"。冷水池的运作遵循严格的优胜劣汰——只有评分最高的假设才能留下,LLM被要求针对已知的高分区域进行精细优化,就像一位经验丰富的厨师反复打磨一道招牌菜的细节。热水池则完全不同,选择标准宽松得多,LLM被要求大胆尝试结构上更新颖、更多样的方向,哪怕当前评分并不突出,就像同一家餐厅里的研发厨师,专门负责实验各种稀奇古怪的新口味。

两个鱼池各自独立运作,但每隔固定的若干轮,系统会进行一次"换鱼"操作。从两个池中各随机抽取若干候选假设,按照Metropolis-Hastings规则决定是否真正交换。这个规则的本质是:如果热水池里有一条"鱼"(假设)在冷水池的标准下也足够好,那么它很可能被调入冷水池;如果冷水池里某条鱼开始停滞不前,它有机会被送入热水池接受更大幅度的改造。

换鱼不是无原则乱换的。为了让整个系统工作稳定,团队引入了一个叫做ξ(xi,读作"克西")的自适应参数,专门用来调节交换被接受的概率,使其始终维持在一个合理区间(大约30%到50%)。这个参数会根据近期的换鱼成功率自动调整,当换鱼太频繁时就适当提高门槛,当换鱼太少时就降低门槛,确保两个鱼池之间保持恰到好处的信息流动。

值得强调的是,这种交换机制比直接迁移或简单合并两个候选池要精妙得多。研究者把简单迁移类比为不加区分地把热水池里的鱼全部倒入冷水池——结果可想而知,冷水池原有的精细结构会被破坏,探索进度几乎归零。而Metropolis-Hastings规则确保了信息流动的选择性,既不打断冷水池的收敛进程,又持续为其注入来自热水池的多样性。

四、在分子世界里找药:比其他方法多发现一倍的候选分子

研究团队首先在药物分子设计任务上测试了EvoDiverse,具体选用了两个经典基准任务:寻找对JNK3激酶(一种与阿尔茨海默症相关的蛋白质)和GSK3β激酶(一种与糖尿病和神经退行性疾病相关的蛋白质)具有强抑制活性的小分子化合物。这类任务的特点是评分函数代价高昂(现实中对应着实验室合成和生物活性测试),因此预算有限,每轮只能评估有限数量的新候选分子。

实验遵循的是领域标准协议,从包含约25万个商业可用化合物的ZINC-250K数据库中随机抽取120个分子作为初始种群,在总共1万次评分调用的预算内进行搜索。研究使用了当时最先进的开源大语言模型DeepSeek V3.2作为分子生成器。

EvoDiverse与三种对照方案进行了比较。第一种是MOLLEO,一个单池进化算法,代表当前最先进的LLM增强分子优化方法;第二种是Ensemble,维持两个相互独立、永不交流的池子,最终合并两池的候选分子;第三种是Tempering,单个热温度的进化搜索,只管探索不管收敛。

评价指标有两个核心维度。一个是多样性感知的Top-10平均分(Top-10 Avg),即在保证候选分子之间结构相似度低于一定阈值的前提下,筛选出最优10个分子的平均得分;另一个是多样性感知Top-10的面积下曲线(Top-10 AUC),衡量在整个搜索过程中高质量多样性候选分子出现的速度,也就是搜索效率。

数据结果相当清晰。在JNK3任务中,EvoDiverse的Top-10 AUC达到0.63,显著高于MOLLEO的0.58、Ensemble的0.54和Tempering的0.46;Top-10平均分达到0.74,同样高于所有对照方案。在GSK3β任务中,EvoDiverse的Top-10 AUC为0.76,同样领先。

一个特别值得关注的观察是候选分子的数量差异。在实验收敛时,EvoDiverse能稳定地产出约90个通过多样性筛选的候选分子,而MOLLEO只产出约50个。候选分子几乎翻倍,意味着研究者在实际药物开发中可以选择的余地大幅增加,遭遇全军覆没的风险显著降低。

研究团队还特别验证了一个重要的"反作弊"指标:被发现的高分分子是否真的具有良好的药物性质,还是仅仅在数值上讨好了评分函数。他们检查了每个方法筛选出的候选分子的QED分(药物相似度,衡量分子是否像一个合格药物)和SA分(合成可及性,衡量分子在实验室中能否被合成出来),发现EvoDiverse在维持高活性评分的同时,依然保持了较高的QED和SA指标,没有产生那种"纸面评分好看但实际毫无用处"的奇形怪状分子。

此外,团队还借助t-SNE降维可视化技术,将EvoDiverse探索到的分子与ChEMBL数据库(收录了数百万已知药物和药物候选分子)进行对比,发现EvoDiverse的候选分子不仅遍布已知化学空间,还有相当一部分延伸到了已知分子数据库之外的区域,说明该方法确实在探索真正的创新化学空间,而非简单地在已知分子附近微调。

最后,为了验证这些候选分子能否经得住更严格的考验,团队用UniDock软件对候选分子进行了物理模拟对接实验。结果显示,EvoDiverse产出的分子在对接分数(衡量分子与目标蛋白质的结合亲和力)上仍然优于或持平于其他方法,且方差更小,说明发现的分子质量更稳定可靠,而非依赖运气。

五、从观测数据猜方程:在四个科学领域里击败竞争对手

第二个测试场景是科学方程发现,也称符号回归。这个任务的目标是:给定一批实验观测数据,让AI自动猜测出背后的数学公式。例如,给定一系列质量和加速度的测量值,AI需要推断出F=ma这个关系。这比药物发现更具挑战性,因为假设空间是离散的数学表达式组合空间,正确答案必须在数值精度、数学简洁性和物理意义上同时满足要求。

研究使用了LLM-SRBENCH这个专门为评估LLM方程发现能力设计的基准测试,覆盖物理学、生物学、化学和材料科学四个域。每个任务允许最多1000次方程评估。两个大语言模型(DeepSeek-V3.2和GPT-5)被分别用作方程生成器,以检验方法的鲁棒性。

结果在所有四个科学领域表现一致:EvoDiverse的候选方程多样性指标(用CodeBERT语言模型提取方程代码的向量表示,计算两两之间的余弦距离)均高于Tempering和Ensemble两种对照方法;同时,最佳方程精度(Best Acc0.1,要求预测值与真实值的最大相对误差不超过10%)和Top-10方程精度(Top-10 Acc0.1,对最优10个方程的平均精度)也同样领先。

以物理学域为例,EvoDiverse的Best Acc0.1为0.408,Tempering为0.301,Ensemble为0.283;多样性指标分别为0.305、0.294和0.287。在生物学这个被认为最难的域中,EvoDiverse的Best Acc0.1达到0.212,而两种对照方法均只有0.104——整整翻了一倍。

研究团队还绘制了优化过程曲线,即随着评估次数增加,当前最优方程的误差如何下降。曲线显示,EvoDiverse在几乎所有任务和两个大语言模型配置下,都呈现出更陡、更快的下降速度,在相同预算内达到了更低的误差水平,意味着更快的搜索效率。

一个重要的技术细节值得提及。在方程发现任务中,由于不同方程的MSE(均方误差)可能跨越许多数量级(从10的负8次方到10的正1次方都有可能出现在同一次搜索中),如果在Metropolis-Hastings换鱼规则中直接用MSE值计算,会导致数值不稳定,使得换鱼规则几乎永远不会接受来自热水池的候选方程。研究团队发现,对MSE取对数之后再用于换鱼判断,可以使不同规模的误差在同一个尺度上被公平比较,从而保持稳健的信息交流。这个看似小的工程细节实际上对最终效果影响显著——使用原始MSE换鱼的方案,在生物学任务上的Best Acc0.1只有0.042,而使用对数MSE的正式方案达到了0.250,相差近六倍。

六、教AI写程序解决几何难题:圆的填充问题里的冠军表现

第三个测试场景是算法发现,具体任务是圆填充优化问题:在一个单位正方形里放置26个圆,要求所有圆的半径之和尽可能大,且圆与圆之间不能重叠,每个圆也必须完全在正方形边界之内。

这个任务乍听起来像是一道数学竞赛题,但它实际上非常难。26个圆的位置和大小构成了一个高度非线性的组合优化问题,存在数量庞大的局部最优解,而全局最优解至今无人知晓。研究中AI的任务是:写出一个Python程序,这个程序运行之后能自动计算出一个尽可能好的26圆填充方案。也就是说,AI要学会"如何写出解决这个问题的算法",而非直接给出答案。

这次实验设置了四种对照方法:标准单池进化算法(EA)、岛屿模型进化算法(Island,两个池子定期频繁迁移)、纯集成(Ensemble,两个完全独立的池子)、以及EvoDiverse。预算同样为1000次程序评估,使用DeepSeek-V3.2作为程序生成器。

实验结果中,EvoDiverse发现的最优方案达到了半径之和2.5461,显著优于EA的2.4986、Island的2.4247和Ensemble的2.4105。在多样性指标上,EvoDiverse以0.78位居第一,Island以0.48垫底(因为频繁的随机迁移导致两个池子的程序几乎完全同质化),Ensemble以0.76位居第二但优化质量最差。

研究团队还详细追踪了EvoDiverse在整个搜索过程中发现的关键策略突破:从最初的简单放置,逐步演化出六边形网格排列,再到边界优先加贪心局部搜索,进一步发展出模拟退火局部搜索,最终形成了带有超参数调整的迭代精炼策略。这条演化路径本身就是一个对人类程序员很有价值的算法设计启示。

通过对两个池子内程序分布的PCA和t-SNE可视化分析,研究者发现EvoDiverse的冷水池和热水池确实形成了具有部分重叠的两个不同聚类:冷水池的程序集中在高分区域,热水池的程序分布在更广泛的低分到中分区域。重叠区域正好对应那些经由换鱼机制从热水池成功进入冷水池并在冷水池中被进一步优化的程序。而Island的两个池子,在同样的可视化下几乎完全重叠成一个点,印证了频繁随机迁移导致种群同质化的问题。Ensemble的两个池子则完全分离,没有任何信息流动,而且有趣的是,两个独立池子中有一个几乎没有为最终精英候选集贡献任何程序,意味着计算资源被严重浪费。

七、严谨性验证:消融实验和统计显著性检验

研究团队用一系列消融实验来拆解EvoDiverse的哪个部分真正起作用。

在所有三个任务中,他们都比较了"有Metropolis-Hastings规则的换鱼"和"无MH规则的随机换鱼"两种变体。结果显示,随机换鱼(即接受所有换鱼请求)通常优于完全不换鱼的Ensemble,说明跨池信息交流本身有价值;但有MH规则的EvoDiverse进一步优于随机换鱼,说明选择性换鱼比盲目换鱼更有效。在圆填充任务中,随机换鱼甚至破坏了热水池的多样性(热水池和冷水池的程序多样性变得几乎相等),而MH规则保留了热冷两池各自的特性(热水池多样性0.712,冷水池多样性0.529)。

研究团队还测试了在两个池子中使用完全相同的LLM提示词(而非分别使用探索性和收敛性的不同提示)的情况,以排除提示词工程的影响。结果发现,即使使用完全相同的提示词,EvoDiverse在JNK3任务上的Top-10 AUC仍比MOLLEO高12%,在GSK3β任务上高19%,确认了核心收益来自并行回火机制本身,而非提示词的差异。

在方程发现任务中,团队进一步测试了使用三个温度层级(β∈{0.8, 0.2, 0.01})的扩展版本,发现与双温度版本相比性能略有提升(多样性从0.308升至0.316,Best Acc0.1从0.416升至0.421),验证了框架可以自然地扩展到更多温度层级。

对超参数敏感性的系统测试显示,方法对温度设定的容忍度相当高:在物理学任务子集上,冷水池β?在{0.8, 1.0}范围内配合β?≤0.1均能稳定工作,性能只在极端配置(β?=1.5或β?=0.5接近消除温度差异)下才出现明显下降。换鱼周期在2到5次迭代之间效果良好,批次大小k≥3即可保持稳健,体现了方法在实际使用中的易用性。

统计显著性检验方面,在方程发现任务中(覆盖多个数据集和多个随机种子),EvoDiverse对Tempering和Ensemble的改进均达到p<0.001水平;在分子发现任务中,JNK3上对MOLLEO的改进p=0.011,对Tempering的改进p=0.006,具有统计学显著性。

说到底,这项研究揭示的是一个科学发现中非常基础但容易被忽视的问题:当验证代价高昂且结果充满不确定性时,我们需要的不是一个全力冲向单一最优解的AI,而是一个能同时维持多条有价值探索路线的AI。EvoDiverse通过将物理学中已被充分验证的并行回火思路引入大语言模型驱动的进化搜索,提供了一个在三个截然不同的科学领域均有效的解决方案。冷水池精炼、热水池探索、中间通过有原则的信息交换相互促进——这个框架简洁而有效,让AI科学探索在优化质量和候选多样性之间找到了更好的平衡点。

这项工作留下的一个开放性问题是:最佳的温度数目、温度间距和换鱼频率目前仍需要针对任务进行经验性调整,未来是否可以进一步自动化这些设置,是研究团队明确指出的后续方向。感兴趣的读者可以通过arXiv编号2606.10587查阅完整论文,或访问研究团队在GitHub上公开的代码库(zoom-wang112358/EvoDiverse)进行实验复现。

Q&A

Q1:EvoDiverse和普通进化算法的本质区别是什么?

A:普通进化算法只维护一个候选方案池,随着迭代进行,评分越低的方案越容易被淘汰,最终整个群体趋向同质化。EvoDiverse同时维护冷热两个候选方案池,分别承担精细优化和广泛探索的职责,并通过Metropolis-Hastings换鱼规则在两池之间有选择地交换候选方案,从而在相同预算内同时实现高质量和高多样性。

Q2:并行回火算法中的"温度"在AI假设搜索里具体控制什么?

A:温度通过一个叫做β的参数控制候选方案的选择压力。β越大(即温度越低),选择越严格,只有高分候选方案才能进入下一轮繁殖;β越小(即温度越高),选择越宽松,评分一般甚至较差的候选方案也有更大概率被选中,从而维持群体多样性并帮助搜索跳出局部最优。

Q3:EvoDiverse在真实药物发现中能带来什么实际价值?

A:在药物开发中,候选分子必须经过实验室合成和生物活性测试才能被最终验证,这个过程代价极高。EvoDiverse能在相同评估预算下提供约90个结构多样且评分较高的候选分子,相比对照方法约50个的产出几乎翻倍,且这些分子在药物相似度和合成可及性指标上表现良好,并在独立的UniDock对接模拟中保持了竞争力。更多样的候选池意味着某个分子在实验中失败后,研究者仍有更多备选方案可以继续推进,降低了整个研究项目因单一候选失败而停滞的风险。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-