微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 上海AI实验室造出"AI科学家",顶级物理化学难题准确率仅33%?他们的新框架把这个数字拉高了

上海AI实验室造出"AI科学家",顶级物理化学难题准确率仅33%?他们的新框架把这个数字拉高了

2026-06-25 09:17
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-25 09:17 科技行者

这项由上海人工智能实验室、厦门大学、中国科学院物理研究所、北京凝聚态物理国家实验室、凝聚态物理数据中心、伦敦大学学院及武汉大学等多家机构联合完成的研究,以预印本形式发布于2026年6月,论文编号为arXiv:2606.18648。有兴趣深入了解的读者可通过该编号查阅完整论文。

你有没有想过,如果有一个"AI助手"能自己翻文献、自己写代码、自己做实验设计,然后告诉你"这个材料在低温下的声子平均自由程大约是15微米"——这个助手到底有多靠谱?

这就是这篇研究试图搞清楚的核心问题。研究团队扮演了一个严格的"考官"角色:他们不仅亲手设计了一套专门考验AI"科研能力"的试题集,还开发了一套新型的多智能体协作系统,试图让AI真正胜任物理学和化学领域里那些复杂的研究任务。结果既有些令人警醒,也有些令人振奋。

一、为什么需要一个专门考AI"科研能力"的考场?

如果你家里有一位高考生,你大概知道,语文、数学、物理的考试方式完全不同——不能用一张同一形式的卷子把他们全考了。AI系统也面临类似的困境。

目前,业界已经有不少测试AI能力的"考卷",但研究团队发现,这些考卷要么太偏重"记忆型"问题——也就是AI只需要从它训练时"背过"的知识里翻出答案就行;要么虽然号称是"科研导向"的,但只包含纯文字问题,完全回避了真实科研中必须面对的图表读取、代码编写和数据库查询等操作。

真实的物理学或化学研究者每天在干什么?他们在阅读充满复杂图表的论文,从这些图表里提取数据;他们在查阅数百页的实验记录,在海量文字里找到那一句关键的实验参数;他们在设计新的合成路线,写Python代码跑量子计算模型。这些任务,现有的AI考卷完全没有覆盖到。

正因如此,研究团队决定从零开始,亲手打造一套真正贴近物理科学研究实际的评测基准,他们把它命名为PhySciBench。

二、这套"考卷"是怎么出题的?

PhySciBench的出题过程,有点像一所顶尖高校命制高考题的流程——严格、繁复,而且充满了反作弊设计。

整个流程分为四个阶段。首先是创作阶段,领域专家从最近五年内发表的高影响力物理和化学论文中汲取素材,或改编自权威教材中的经典问题,然后完全原创地撰写题目。这里的关键词是"原创"——因为如果题目是直接从网上已有材料复制过来的,那AI完全可能在训练时就"背"过这道题,考试就失去了意义。

完成初稿之后,进入同行交叉审核阶段,由其他专家检查题目的科学事实是否正确、质量是否达标。审核中出现分歧的题目,进入裁决阶段,通过讨论统一答案标准,整合评分细则。最后还有一个自动化漏洞筛查加人工复验的验证阶段,专门揪出那些"只要上网搜一搜或者靠AI自身知识就能答对"的题目,把它们踢出题库。整个流程是一个迭代循环,不合格的题目会被退回重做。

最终成型的PhySciBench包含200道题,物理和化学各占一半,每方向各100题。题目按照六种任务类型分布,而这六种类型又被归纳进三个递进的认知层次,就像学习台阶一样一层一层往上走。

第一个认知层次叫"信息提取",包含两类任务:多模态问答和结构化信息提取。前者要求AI读懂科学图表——比如看一张能带图说出材料的某个物理性质;后者要求AI从非结构化文字里提取有用信息,把它整理成标准化的JSON或CSV格式记录,就像一个数据录入员。这个层次考的是AI能不能"看懂"和"读懂"科研材料。

第二个认知层次叫"科学理解",包含长文本问答和科学推理两类。前者要求AI在一篇几十页的长文和附录里找到证据,综合得出结论;后者要求AI做有理有据的多步骤推导,就像解一道需要三四个步骤才能做完的物理大题。这个层次考的是AI能不能真正"理解"科学内容。

第三个认知层次叫"应用与创造",包含实验设计和代码生成两类。前者要求AI为一个具体的化学合成问题设计完整的实验方案;后者要求AI写出能真正运行的代码,模拟物理或化学系统的行为。这个层次考的是AI能不能"创造"出新的科研成果。

题目的难度设计也颇具匠心。从统计数据来看,大多数题目需要20到30个推理步骤,并且要同时用到两到四种不同的工具能力,比如网络搜索、文档读取、多模态理解、文件处理、代码执行和科学分析。这意味着PhySciBench考察的核心,是AI能否像真正的研究者那样,把多个工具组合起来完成复杂的工作流程。

三、现有的AI"学生"考得怎么样?

成绩出来了,说实话,有点不太好看。

研究团队找来了目前业界最强的一批AI模型和AI智能体系统,让它们挨个参加考试。在基础模型阵营里,Gemini-3-Flash拿了28.5分(满分100),Gemini-3-Pro拿了25分,其余模型如Kimi-K2.5、Grok-4.1-Fast等都在22分左右徘徊,GPT-5.2拿了19分,Claude-Opus-4.5拿了17分,Intern-S1-Pro垫底拿了16.5分。

智能体系统稍好一些,但依然不令人振奋。所谓"智能体",是指那种不只是单纯回答问题,而是能主动调用工具、查资料、分步骤解决问题的高级AI系统。业界最强的Gemini Deep Research拿了33.5分,OpenAI Deep Research拿了30分,ODR-smolagents拿了21.5分。

最强选手也只有33.5分——这个分数放在中学考场上,大概勉强及格线都摸不到。研究团队也承认,PhySciBench本就不是一张"让AI轻松得分"的简单卷子,它的设计目标就是要保留足够大的进步空间,让它能长期区分不同水平的AI系统,而不是一上来就被轻松"刷满分"。

为了弄清楚这些AI到底哪里出了问题,研究团队仔细分析了Gemini Deep Research(最强选手)犯下的326个错误案例,把问题归结为三大类。

第一大类是"规划和推理失败",占了46%的错误。具体表现是:AI在解题的早期阶段一旦犯了一个错,这个错误就会像雪球一样越滚越大,一路影响到后面所有的步骤,最终导致整个解题过程崩塌。就好像你在搭积木时,底层放歪了,哪怕上面的每一步都很认真,整座积木楼最终还是要倒。

第二大类是"知识和实现失败",占了23%的错误。AI会生成听起来很像那么回事、但实际上科学上站不住脚的说法,或者写出来的代码、公式看似有模有样,但其实不能正确地表达它试图模拟的那个物理或化学模型。这有点像一个学生看起来在认真答题,但其实用了一个根本不适用的公式。

第三大类是"执行和响应失败",占了31%的错误。工具调用超时了、处理图片文件失败了、输出的答案格式完全不符合题目要求——这些都属于这一类。换句话说,AI不是"不会",而是在"动手操作"这个环节翻了车。

四、针对这三块"短板",研究团队是怎么设计新系统的?

看清了问题所在,研究团队设计了一套叫做DelveAgent的新型多智能体框架,对症下药。

这个框架的整体运作方式,有点像一家高效运转的研究小组:中间有一个核心"规划师"(Planner),它负责把大任务拆解成一个个小任务,然后分配给五个专业化的"执行员"(Workers),这五个执行员分别擅长网络搜索、文档处理、物理专项、化学专项和代码执行。执行员完成任务后,产出的结果要经过一个层级化的"审查官"检验,最终才汇总成完整的答案。在整个过程中,一个共享的"记忆库"向规划师和执行员们持续提供支持。

针对"规划和推理失败"的问题,DelveAgent引入了自适应规划循环机制。传统的AI系统往往是"一条路走到黑"——一开始定好了解题方案,哪怕中间发现方向错了也不回头调整。DelveAgent的规划师则不同,它会不断观察执行员反馈回来的中间结果,一旦发现有什么不对劲,就会立即调整后续的行动方案。整个解题过程是一个"制定计划→执行子任务→观察中间结果→修正计划"的持续循环,而不是一次性拍板定案。为了防止这个循环里积累的上下文信息越来越多导致"记忆溢出",系统还内置了一个Summarizer模块,每三步就把历史记录压缩总结一次,让规划师始终保持清晰的工作状态。

针对"知识和实现失败"的问题,DelveAgent建立了双粒度记忆系统。这个记忆系统分成两层。上层是"经验记忆",存储的是成功的解题轨迹、从失败中学到的恢复策略,以及各种有效的任务分解模式——相当于一个"成功案例档案室",每当遇到新任务,规划师会自动从档案室里调取最相似的历史经验作为参考,每次至多调取最相关的三个案例。下层是"知识记忆",里面存放的是具体的科学知识:方程式与物理原理、实验操作流程与方法、物理常数与科学事实——相当于一本随时可查的专业教科书,而且这本教科书是在AI解题的过程中逐步从相关论文里积累和扩充起来的。执行员在工作时可以随时查阅这本教科书,让它的推导和代码更有科学依据。

针对"执行和响应失败"的问题,DelveAgent设计了层级化物理验证反思机制。这套机制分两个层级运转。第一个层级是"本地核验员",专门检查每一个执行步骤的合理性,比如:单位和量纲对不对?用的公式和假设有没有问题?代码跑起来对不对?工具输出的结果合不合理?一旦发现错误,在问题还小的时候就触发局部修正,而不是等到最后才发现全错了。第二个层级是"全局评审员",在整个解题轨迹即将结束、准备给出最终答案之前,对整体答案做一次全面审查,检查的维度包括:答案有没有依据来源材料?科学逻辑是否自洽?输出格式是否符合题目要求?通过检查后才允许给出最终答案。此外,每次成功完成任务后,整个解题轨迹会被Learner模块提炼并存入经验记忆,供未来参考,形成一个完整的闭合认知回路。

五、新系统的成绩单如何?

效果相当不错。

在PhySciBench上,DelveAgent拿到了41.0分,比此前最强的Gemini Deep Research(33.5分)整整高出7.5个百分点。按照任务类型细看,它的进步非常有规律地对应着各个模块的设计意图。

在结构化信息提取任务上,得分提升了15个百分点——原因是双粒度记忆系统里存储了格式模板,帮助执行员避免了大量的格式错误。在代码生成任务上,同样提升了15个百分点——因为自适应规划循环让系统能够在代码报错后迭代调试,而不是一次失败就放弃。在多模态问答任务上,提升了7.7个百分点,反映出物理验证反思机制在处理图表理解任务时的价值。在长文本问答任务上,提升了10个百分点,说明双粒度记忆对跨文档证据整合有显著帮助。在科学推理任务上,DelveAgent追平了最强基准水准(58.3分)。唯一没有实现突破的是实验设计任务,它与Gemini Deep Research平手,都停在17.1分——这也许是当前所有系统在这类创意性、开放性任务上共同面临的瓶颈。

更让人欣喜的是,这些提升是在大幅降低推理成本的前提下实现的。跨四个科学测试基准,DelveAgent的单题平均推理成本约为Gemini Deep Research的三分之一左右。换句话说,它不仅考得更好,花的"钱"还少得多。

研究团队也做了拆解实验,分别关掉三个核心组件,看看成绩会掉多少。关掉双粒度记忆,成绩下降3个百分点;关掉层级化物理验证反思,也是下降3个百分点;关掉自适应规划循环,下降2.5个百分点。这三个下降幅度相当接近,说明三个模块对系统整体性能的贡献是相互补充、不可偏废的。把三个组件全部关掉,成绩下降6.5个百分点——比三个单独下降值加起来(8.5个百分点)要少,说明这三个机制之间存在一定的相互补偿关系,任何一个出故障,另两个能在一定程度上顶上来。去掉所有三个组件后,DelveAgent与Gemini Deep Research的差距从7.5个百分点缩小到1个百分点,有力地说明了这7.5个百分点的提升确实是架构设计带来的,而不是底层语言模型本身的差异造成的。

六、放到其他测试上,表现稳不稳?

一个好的系统,不能只在自家设计的考卷上考高分——那叫"自说自话"。研究团队把DelveAgent拿到三个完全独立的公开测试基准上去检验。

第一个是HLE(Humanity's Last Exam,人类最终考试),从中选取了395道物理和化学问题,这套题以封闭式、高难度著称,专门设计成"靠搜索引擎找不到答案"的类型。DelveAgent得到34.94分,Gemini Deep Research是33.67分,小幅领先。

第二个是SGI-DR,这是一个专门测试"深度研究"能力的跑道,包含43道需要在复杂科学内容中进行迭代推理的专家级问题。DelveAgent拿到了20.93分,而Gemini Deep Research是13.95分,差距接近7个百分点——这恰恰是自适应规划循环和双粒度记忆最能发挥作用的任务类型。

第三个是FS-Research(FrontierScience-Research,前沿科学研究),包含40个完全开放式的研究任务,用一套10分制的专家评分标准打分。DelveAgent和Gemini Deep Research打平,都是15.00分。

跨三个测试的平均分,DelveAgent是23.62分,Gemini Deep Research是20.87分。这意味着DelveAgent的优势不仅在自家设计的PhySciBench上成立,在其他独立评测环境下同样可以复现。

七、真实科研任务:AI在实验室里能用吗?

数字测试之外,研究团队还找来三位真正的物理科学领域专家,每人从自己正在进行的研究课题里提取了一个真实任务,交给AI来完成。

第一个任务来自凝聚态物理的实验领域:解读一组温度依赖的ARPES(角分辨光电子能谱,一种专门探测材料电子结构的实验技术)数据,在k∥-Γ点附近定量提取能隙大小,并提供可重复运行的代码。

第二个任务来自量子拓扑物理理论:在严格的参数约束条件下,数值复现1D Floquet Majorana α链(一个描述拓扑量子相变的理论模型)的核心计算结果,包括可运行的代码、数值输出文件和简短的验证说明。

第三个任务来自量子材料实验:综合分析一批应变调控Kagome金属(一类具有特殊晶格结构的新型量子材料)的实验数据,在三个相互竞争的超导增强理论解释中排出优先级。

三个任务分别交给DelveAgent和Gemini Deep Research完成,输出结果由三位独立的物理科学领域专家在不知道哪个答案来自哪个系统的情况下,从任务完成度、科学有效性和幻觉程度(越低越好)三个维度各打0到10分。

平均下来,DelveAgent在任务完成度上拿到了8.39分,Gemini Deep Research是7.50分。在科学有效性上,DelveAgent是8.05分,Gemini Deep Research是6.39分。在幻觉程度上,DelveAgent是3.02分,Gemini Deep Research是6.05分——这里越低越好,意味着DelveAgent编造的、在数据里根本没有依据的内容明显更少。

在第一个ARPES任务里,Gemini Deep Research给出了一个"结论不够确定,建议追加实验"的答案,而没有基于现有数据给出确切的狄拉克锥解读;专家给它的科学有效性打了2.83分,幻觉程度打了7.33分,反映出它倾向于用推测性的表述来"填充"答案中那些数据不足以支撑的部分。DelveAgent在相同数据上给出了更明确的解读,科学有效性拿到6.33分,幻觉程度只有2.83分。

在第三个Kagome金属任务里,两个系统都认可"近CDW/向列相失稳引起的涨落介导配对"是最合理的主导解释,但Gemini Deep Research在描述时额外引入了一些实际上根本没有出现在研究者提供的数据包里的数值(比如某些输运增量和弹性电阻幅值),幻觉程度被打了8.50分,而DelveAgent只有4.07分。

在第二个FMAC数值复现任务里,两者表现最为接近,因为这个任务有明确的数值目标——答案对不对,跑一遍代码就知道了。DelveAgent在幻觉程度上仍略优,2.17分对2.33分,差距已经很小。

从这三个任务里还能观察到一个有意思的细节:在第二个任务的完整执行轨迹里,规划师先让执行员提取了理论框架,然后实现了一版初始的数值求解器;但执行员在运行时发现输出的绕数指数是分数而非整数,这是一个物理上明显不对的信号。于是规划师立即重新规划,让执行员按照正确的Majorana算符形式重写求解器,最终正确复现了论文里的拓扑相图和边缘态。这个过程清晰地展示了自适应规划循环在真实任务里的工作方式——不是一次性给出答案,而是在中途发现错误、及时纠偏。

归根结底,这个研究告诉我们一件相当重要的事:让AI真正能干科研,靠的不是简单地把语言模型变得更大、上下文窗口做得更长——更关键的是要给它配上合适的"认知脚手架"。一个能及时改变计划的规划大脑、一个能记住经验和知识的记忆系统、一个能检查自己有没有犯物理错误的反思机制,这三件事加在一起,才能让AI从"看起来在做科研"进化到"真的在做科研"。

当然,这条路还很长。PhySciBench上的最高分也只有41分,还有将近60分的空间等待被填满。幻觉问题、专业图表理解的瓶颈、跨文档信息的准确归因,这些都是当前包括DelveAgent在内的所有系统仍然面临的真实局限。研究团队也坦承,目前这套框架里的知识记忆库是边做题边积累的,不能保证覆盖所有子领域,未来需要持续扩充。同时他们也特别强调,AI生成的科研内容必须由人类专家进行严格审查,尤其是在有真实后果的应用场景里,不能简单地"把结果复制粘贴到论文里"。

这项研究已在GitHub上开放了数据和代码,欲进一步了解的读者可通过arXiv:2606.18648查阅完整论文。

Q&A

Q1:PhySciBench测试的题目有多难,普通AI为什么考不好?

A:PhySciBench的题目来自近五年高影响力物理化学论文和专业教材,全部由领域专家原创撰写,同时排除了靠搜索或背诵能答对的题目。大多数题目需要20到30个推理步骤,并同时用到网络搜索、文档读取、多模态图表理解、代码执行等多种工具能力。现有最强AI智能体得分仅33.5%,主要原因是它们缺乏在中途发现错误后及时调整计划的能力,同时也难以在多步骤推理中持续调用领域专业知识。

Q2:DelveAgent的"双粒度记忆"和普通AI的记忆有什么区别?

A:普通AI的"记忆"通常就是当前对话的上下文。DelveAgent的双粒度记忆则更像两个专门的档案柜:一个"经验记忆"存的是过去成功的解题轨迹、失败后的恢复策略,每次遇到新任务时自动调取最相似的历史案例参考;另一个"知识记忆"存的是方程式、实验操作流程、物理常数等具体科学知识,会在每次解题时从相关论文里持续积累扩充,让AI的推导和代码有实实在在的科学依据,而不是靠猜。

Q3:DelveAgent和Gemini Deep Research相比,成本差距有多大?

A:在跨四个科学测试基准的评测中,DelveAgent的单题平均推理成本约为Gemini Deep Research的三分之一左右,同时在整体准确率上还高出约7.5个百分点。这意味着DelveAgent不仅表现更好,花费的计算资源还大幅减少,实际可用性更高。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-