
这项由上海交通大学X-LANCE实验室主导、联合上海创智学院、江苏省语言计算重点实验室及苏州实验室共同完成的研究,于2026年6月17日以预印本形式发布在arXiv平台,编号为arXiv:2606.18874v1,归属计算机人工智能领域(cs.AI)。研究团队在论文中介绍了他们构建的系统XCIENTIST,并详细阐述了其在三个不同科研任务上的实际表现。
科研这件事,有一个普通人平时不太留意却至关重要的特质:它不仅仅是得出一个结论,还要让别人能看清楚这个结论是怎么来的。一位法院法官在宣判时,必须给出判决理由;一位医生在开药时,必须解释诊断依据。科学研究也是如此——一个实验结果要被认可,背后的推理链条必须清晰可查、经得起质疑。
然而,当人工智能开始介入科研工作时,麻烦来了。现在的AI系统已经能自动完成科研流程中的许多步骤:搜索文献、提出想法、写代码、跑实验、生成报告。但这些AI的"思考过程"往往藏在模型内部,无从追踪。它从哪篇文献中得到灵感?它的实验设计能真正验证它声称的机制吗?它最终的结论真的来自数据,还是凭空捏造的?这些问题,目前大多数AI科研系统都无法给出令人满意的答案。
上海交大的研究团队将这个问题命名为"声称漂移"(claim drift)——AI提出了一个科研假设,但随着代码编写、实验运行的推进,最终产出的东西已经偏离了最初的假设,而这种偏离没有被记录、没有被察觉,甚至连AI自己也"不知道"。这篇论文正是为了解决这个问题而来的。
一、科研流水线上的隐患:当AI的"推理"变成黑盒
要理解这个问题的严重性,可以回想一个生活场景:你委托一个装修队按照你画的图纸施工,但施工完成后你发现,卧室的门开反了,厨房的插座位置也和设计不符。装修队说"没问题啊,都按要求做了"——但图纸和实物对不上。科研中的"声称漂移"就是这种情况:AI提出的"设计图"(研究假设)和最终"盖出来的房子"(实验代码与结果)之间,出现了无法对应的裂缝。
研究团队专门检查了另一个知名AI科研系统AI-Scientist-v2的三次运行记录,作为反面案例。这三次运行分别对应论文中涉及的三类科研任务,结果很能说明问题。
在记忆系统设计任务中,AI-Scientist-v2 提出了"通过置信度、有效性条件和来源标记来修订记忆"的核心机制,代码也确实实现了修订操作——但这些修订只是对文本的浅层时序更新,没有真正和证据相连,也没有可以独立验证的组件级实验。最终评分混杂了记忆写入、检索、答案生成等多个因素,根本无法判断"记忆修订"这个声称的机制究竟贡献了多少。
在图结构交通预测任务中,AI提出了"一个轻量级的、感知预测时间跨度的空间插件",但实际跑出来的代码是一个全新的独立预测模型,而不是插装在已有强基线上的插件。保存的结果只有一个变体、一个随机种子,没有本地基线,没有控制组,也没有针对"空间适应"机制的专项诊断实验。声称和实现之间的裂缝清晰可见。
在多尺度物理信息神经网络任务中,AI提出了"尺度门控的粗细分支加残差谱平衡",架构代码确实可以运行,但分支损失没有经过频率过滤,门控行为没有被审计,最强的性能提升也没有被单独归因到某个具体机制。更糟的是,最终报告还遗漏了几个可用的基线对比文件。
这三个案例共同说明了一件事:能跑通、有结果、有数字,不等于科学上站得住脚。"可运行的自动化"和"可问责的科学"之间,还差着很大一段距离。
二、XCIENTIST的设计哲学:把"思考过程"变成可检查的档案
研究团队在设计XCIENTIST时,从一个核心理念出发:不要让AI的判断藏在模型内部,而是把它们逐步"外化"为可以被检查、被质疑、被修正的有形结构。
整个系统分为三层,像一座分工明确的大楼。底层是"文献知识图谱基础设施",负责把论文变成结构化的知识地图;中层是"研究执行框架"(Research Harness),是整个系统的控制中枢,负责把知识地图转化为有约束的研究过程;顶层是"用户界面",让人类研究者可以随时查看、介入和审计AI的工作状态。
底层的文献知识图谱是整个系统的基石。研究团队从Semantic Scholar平台索引了大约五万篇计算机科学领域的论文,对每篇论文进行全文解析——而不只是读摘要。这一点很关键,因为一篇论文中真正有价值的细节,比如与哪些基线做了对比、在哪个数据集上测试、存在哪些已知局限,几乎从不出现在摘要里,而是藏在实验章节和附录中。
解析完成后,每篇论文会被提取出两类结构化信息。第一类叫"创意资源字段",记录研究问题、核心贡献、各个组件、创新点、局限性和未来工作方向;第二类叫"图数据字段",记录这篇论文与哪些基线方法做了对比、用了哪些数据集。所有文本字段都以"关键词+摘要+洞察+原文引用"四元组的形式存储,确保任何一条信息都能追溯到原始论文的具体段落。
最终构建出的知识图谱包含约七万两千个核心方法节点、二十五万个基线节点、六万三千个数据集节点,以及超过一百一十五万条有类型标注的边。这张图谱不仅记录了各个方法的内容,还记录了它们之间的关系:谁是谁的改进版本,谁与谁做了对比,谁在哪些任务上表现更好。
中层的研究执行框架则是XCIENTIST真正的核心。它的设计哲学可以用一句话概括:每一步推进都必须产生可检查的证据,否则不允许进入下一步。文献综述产生结构化的调研报告;创意生成在明确的新颖性和可行性约束下搜索和融合候选机制;实验验证将选定的机制分解为实施、运行、消融和修复四个阶段,每个阶段都有独立验证器把关;报告撰写则会审计所有声称是否与代码、数据和引用文献保持一致。这个"创意-验证-进化"循环是XCIENTIST区别于其他AI科研系统的核心设计。
三、文献综述不是"搜索+复制",而是建立可查证的知识骨架
XCIENTIST的文献综述模块采用了一个叫做DeepSurvey的系统。它的工作方式和普通的关键词搜索截然不同,更像是侦探建立案件关系图。
给定一个研究主题,DeepSurvey首先找到最相关的种子论文,然后沿着这些论文的引用网络向外扩展,发现那些与主题有结构性关联但关键词相似度不高的论文——这类论文往往恰恰是最重要的背景文献,却最容易被普通关键词搜索漏掉。扩展完成后,系统用两轮过滤控制质量:粗筛阶段用语义相似度快速排除明显不相关的论文,细筛阶段则请大语言模型结合研究主题做精细判断。
通过过滤的每篇论文都会生成一份全文"要点摘要",采用开放式结构记录贡献类型、核心机制、实验设置、局限性和失败案例。接下来,这些论文被聚类成若干主题群组,每个群组内部进行三种互补的分析:关系图分析(捕捉方法之间的"基础-扩展-替代-互补"关系)、对比表分析(在目标、机制、实验设置、局限性等维度上系统对齐各篇论文),以及引导式问答综合(围绕高价值技术问题合成跨论文的证据)。
如果目标论文有开源代码,系统还会克隆代码仓库,识别核心文件,生成伪代码摘要,报告实现模式和依赖约束。这种代码级别的分析能暴露论文文字中看不到的实现细节和工程限制。
最终的综述撰写遵循"先规划后写作"的流程:系统先生成层级大纲,把论文明确分配到大纲的各个章节,然后从小节到章节逐步起草文本,每段生成后立即验证引用是否准确。生成完成后还会进行多粒度的智能体精修,分别在章节级别、小节级别和全文级别检查逻辑、可读性和引用准确性。
论文中给出了一个具体案例:以"自动综述生成"为研究主题,XCIENTIST生成的综述大纲共八个章节,聚焦于自动综述生成的历史演进、系统架构、核心组件、评估标准、挑战和未来方向。每个章节都有明确的分析视角和分配的论文子集,形成了一个逻辑严密、证据可追溯的知识结构。相比之下,用AutoSurvey(另一个自动综述系统)生成的大纲包含了大量与主题无关的内容(如数据众包平台、移动传感器数据采集),且缺乏对现有方法局限性的批判性分析和对未来方向的具体预测。这种差异直接来自于分析基础的深浅:XCIENTIST从结构化的知识骨架出发写作,而不是凭模型的统计直觉生成文字。
四、创意生成不是"头脑风暴",而是在有约束的空间里系统搜索
XCIENTIST生成研究想法的方式,和人们通常想象中AI"创作"的方式很不一样。它不是让模型自由发挥,输出一堆听起来有道理的想法,然后人工筛选。而是把创意生成建模为一个在结构化空间中进行的搜索过程,搜索的每一步都受到明确约束。
搜索的起点是"根创意",这个根创意不是模型凭空生成的,而是从文献知识图谱中识别出的一个验证过的研究空白——某个领域共识存在但现有方法还没有很好解决的问题。以论文中的记忆系统任务为例,文献图谱分析发现,许多记忆设计关注了召回率或抽象能力,但对"检索到的信息是否可归因于稳定的记忆单元"几乎没有保证。于是根创意被设定为:应当从"重量级记忆改写"转向"原子级证据保留加约束读取"。
在这个根创意的基础上,系统通过蒙特卡洛树搜索(MCTS)探索候选机制。每个创意被表示为一组可编辑的组件,搜索的每一步操作都是对这些组件的增删替换或重连。这种表示方式的好处是:搜索空间虽然很大,但每一步都是具体的、可解释的组件级操作,而不是模糊的文本修改。
搜索过程还引入了两种记忆机制。向量记忆存储来自其他搜索轨迹的经验,包括哪些编辑操作奏效、哪些方向失败,这些经验会在后续搜索中被检索并用于指导新的扩展;符号记忆来自之前实验验证阶段的组件消融结果,也就是说,如果某个组件在上一轮实验中被证明无效,这个信息会直接反馈到下一轮的创意搜索中,让系统避免重蹈覆辙。
XCIENTIST还设计了"创意口味模式"(Idea Taste Modes)这个有趣的机制。同一个研究问题,系统会从五种不同的偏好视角去探索:高风险高回报的探索型、跨领域迁移型、稳健工程型、雄心勃勃但可实现型、证据优先型。每种模式会产生风格和取向都不同的候选创意,这些候选创意再经过一个"融合"步骤整合为最终提案。
融合步骤特别值得关注。系统不是简单地合并所有候选创意,而是选定一个"主导创意"作为核心论题,然后评估其他候选创意中的每个组件,判断它是否能支持这个核心论题、强化验证或修复某个具体弱点,同时不引入竞争性的新颖性声称。被保留的组件必须有明确的角色定位,被丢弃的组件必须有明确的原因记录。最终产出的融合创意还要经过一轮独立评审和本地修复,才能进入实验验证阶段。
这一整套机制确保了创意不是随机生成的灵感,而是在文献证据约束下、通过系统搜索得到的、经过多视角检验的机制假设。
五、实验验证不是"跑一跑看结果",而是合约驱动的逐步举证
XCIENTIST的实验验证模块设计了一套严格的"合约"体系。它的三个核心原则是:验证器至上(每个阶段都必须通过独立验证器的检查,才能进入下一阶段),关注点分离(规划、执行、验证由不同的功能层负责,不允许一个组件既执行操作又判断自己的操作是否成功),以及工作区封装(每次实验都在隔离的项目目录中运行,所有路径、权限、数据集、模型、环境变量都在版本化的配置文件中明确声明)。
验证流程分为四个主要阶段:准备、代码实现、标准科学实验和消融科学实验。
准备阶段负责建立实验的物质基础:获取代码仓库、构建运行环境、暂存数据集和模型。这个阶段分为五个顺序步骤,每个步骤都必须通过独立验证器的检查才能进入下一步。准备完成后,系统会生成两个权威交接文件:一个机器可读的清单,记录验证过的仓库路径、数据集文件、模型标识符和基准测试入口;一个人类可读的文件,重述研究想法、完整保留所有规范组件的名称和顺序,并提供实现指导。后续所有阶段都把这两个文件当作问题定义和组件约束的唯一真实来源。
代码实现阶段要求实现团队将研究提案转化为完全自包含的可运行代码。代码必须支持对每个规范组件单独禁用,且禁用某个组件不影响其他组件的行为——这是消融实验的前提条件。所有代码必须在项目目录内,不允许依赖外部路径。如果从参考代码库复制了代码,必须留下来源清单,记录每个文件从哪里复制、原因是什么。实现阶段必须以一个完整链路的冒烟测试收尾,证明整个实验管道在真实数据上能跑通。
标准科学实验阶段运行基线版本(禁用所有组件)和完整方法版本(启用所有组件),在相同条件下产生可对比的指标。每一步都必须在指定目录下产生真实的执行产物,验证器会检查这些产物是否真实存在。
消融科学实验阶段则系统性地逐个禁用每个规范组件,其余组件保持不变,测量每个组件的边际贡献。消融计划的步骤数必须恰好等于规范组件的数量,每个步骤对应一个组件,按照完全相同的顺序排列。任何组件都不能从证据集中被省略。
只有当所有阶段都通过了验证器的审核、没有未解决的阻塞问题,并且每个组件都有对应的消融证据时,系统才会宣告收敛。如果达到最大迭代次数仍未收敛,系统会明确记录"因达到迭代上限而停止",防止不完整的证据被当作已验证的结论。
六、三个真实科研任务上的完整轨迹
论文通过三个任务详细展示了XCIENTIST的完整工作过程,每个任务都有清晰的进化轨迹。
第一个任务是为大语言模型智能体设计无需训练的记忆系统。系统从A-Mem的实现出发,经过文献图谱分析识别出核心问题:现有记忆系统在改写记忆时往往破坏了原始信息的可归因性,导致检索路径难以诊断。
在创意探索阶段,MCTS在"雄心现实主义者"模式下探索了多个方向,包括模块化阶段筛选器、快速切面预过滤器、面向问答的检索、槽感知重排序器、来源表示模型和动态重排序器。槽感知重排序器获得了最高分(3.76),被选中参与融合。融合阶段整合了多个候选中的有效组件,形成核心声称:不可变原子笔记加有界丰富化加确定性槽式检索。
随后识别出的残余缺陷包括:漂移风险、脆性单路径检索和特征堆砌。针对性修复将宽泛的阶段筛选器替换为更精确的槽证据重排序器,把切面句柄从硬依赖弱化为软增强信号,并在元数据缺失或不可靠时引入了降级模式。
进化过程经历了四个大版本:v1.x强调来源可追溯和安全修复;v2.x转向原子优先证据;v3.x压缩读取路径并引入固定束合约;v4.x针对大规模问答和检索优化。最终版本v4.2的整体文本F1从基线的0.306提升到0.391,同时平均输出长度从2844.1 token压缩到1017.2 token,缩减了64.2%。性能提升分布在单跳、多跳、时序、开放域和对抗性问题等所有类别上。
第二个任务是图结构时空预测,以PEMS-BAY交通数据集为基准。系统从Graph WaveNet(一个扩散卷积时序预测模型)出发,文献图谱分析表明:完全替换扩散骨干网络会损害干净数据上的性能,而残差修正机制需要局部消融来验证补充信息是否有实质贡献。
最初的MCTS探索产生了"正交互补融合"设计,使用残差分量的正交投影来强制局部修正只在扩散未解释的方向上工作。这个设计获得了最高的设计评分(3.88),但消融实验揭示了一个关键事实:移除正交投影对干净数据MAE的影响不到0.12%(绝对值仅0.0019)——这个核心机制实际上是功能上无效的。原因在于正交投影对基向量敏感,在编码端存在缺失值的情况下会抑制有价值的局部修正。
基于这个消融发现,系统将"过滤后提案"的接口改为"提案后残差化":稀疏注意力分支先自由地从残差信号中提出局部修正,然后覆盖率单元(innovation coverage cell)再确定这个提案中有多少部分解释了扩散残差,通过标量匹配系数(α = ?a,e?/(?a,a? + λ))保留对应部分。修复后的消融验证表明,移除覆盖率单元使干净MAE上升了0.0042,40%块缺失的鲁棒性也从1.060退化到1.101——这个正面的消融结果与之前负面的正交投影消融结果形成对比,验证了修复的有效性。
最终版本的平均MAE为1.556(基线Graph WaveNet为1.588),60分钟MAE为1.908(Graph WaveNet为1.972),且不需要增加任何模型参数。
第三个任务是多尺度物理信息神经网络(PINNs)设计。这类网络需要用神经网络求解偏微分方程(PDE),难点在于方程的物理约束必须作为损失函数的一部分。多尺度问题的难点在于,单一优化路径往往混淆粗粒度全局结构和细粒度残差模态,导致泛化弱且各分支协调不稳定。
XCIENTIST从文献图谱中提取出核心约束:机制必须能分离全局粗粒度热解和细粒度修正,同时与PDE损失、边界条件损失和初始条件损失保持兼容。经过MCTS探索,系统选定了"Galerkin投影"方向(评分3.70),融合生成了"加性多尺度PINNs的分阶段加法架构":阶段0首先学习权威的粗粒度全局PINN解,然后冻结该解作为停止梯度参考,残差分支在此基础上只学习通过固定低通滤波器投影的细粒度补充。
识别出的残余缺陷是弱泛化和粗细分支之间的协调失败。修复将残差投影模块替换为物理感知的细尺度投影器,并重写了分阶段训练路径,确保残差分支无法在粗粒度骨干稳定之前破坏它。
v3版本(统一全局-局部系统)尽管理论上更完整,但引入了优化耦合,性能反而下滑,证明了理论完整性可能带来实践上的负面效果。v4版本通过分阶段训练恢复了稳定性,v5引入了基于PDE能量的正交补,v6用固定补合约加傅里叶特征坐标替换了自适应骨干条件投影,解决了移动骨干带来的不稳定性。
六个版本的平均排名从v1的6.33提升到v6的2.33。v6在heat1d_multiscale上获得最低的L2误差(0.0672±0.0118),在pinnacle_heat上也是最优(0.4307±0.0139),但在heat2d_multiscale上仍落后于MMPINN(0.00661±0.000995)。论文特别强调了这个不完整胜出的重要性:一个AI科研系统能够诚实地划定自己成功的边界、承认在哪些情况下已有方法更优,这本身就是科学问责能力的体现。
七、报告撰写:让每一个声称都对得上代码和数据
XCIENTIST的报告撰写模块体现了同样的审计精神。它的核心约束叫做"来源保真度":报告中提到的每一个函数名必须在代码中存在,每一个参数值必须与实现中的默认值匹配,每一个文件路径必须对应真实存在的文件。这些验证不是靠AI自我申报,而是通过在实验工作区中直接搜索函数名和参数值来确认。
报告生成流程分为五个阶段。首先是项目探索:系统读取代码文件和实验报告,通过知识图谱检索相关论文,过滤掉内容与实验声称不匹配的论文,生成一份"组合合约",包含项目概览、架构摘要、引用候选表(每篇论文都标注了相关性理由和建议引用位置)。这份合约同时规定了双向引用约束:后续写作只能引用合约中列出的论文,合约中列出的每篇论文都必须在正文中被引用。
然后系统逐节撰写文章,以来源而非模型想象为基础。接下来进行质量审计,从内容质量、工程深度、来源保真度、研究诚信、专家可信度和AI引用准备度六个维度评分(满分100分)。来源保真度权重最高,研究诚信通过检查引用论文的PDF是否存在、声称是否能从PDF内容中得到支持来验证,引用论文缺失或无法核实会直接扣20分。
最后进入迭代精修循环,每轮修复都先在代码中验证问题是否真实存在,再做最小化修改。精修持续到质量分超过90或达到迭代上限。
八、与其他AI科研系统的差异
论文中给出了一个清晰的对比表,将XCIENTIST与AI-Scientist-v2、DeepScientist-v1.5、AI-Researcher、AiScientist、InternAgent-1.5、EvoScientist、ARIS和AlphaEvolve在六个维度上进行了比较:结构化知识、结构化创意进化、合约化验证、证据驱动修复、组件归因、声称边界审计。
现有系统通常在某些维度上有设计,但不系统地覆盖全部六个维度。比如DeepScientist-v1.5有合约化验证但缺乏结构化知识和证据驱动修复;EvoScientist有结构化创意进化但验证和修复机制不完整;AlphaEvolve有组件归因和声称边界审计但在知识结构和修复机制上存在缺口。XCIENTIST是唯一在六个维度上都有明确系统级机制的系统。
这并不意味着XCIENTIST在最终性能上全面超越所有系统——论文中的实验结果也展示了XCIENTIST在某些基准上的局限。但论文的核心主张不是"XCIENTIST跑出了最好的分数",而是"XCIENTIST是唯一能够对自己的研究轨迹给出完整问责链的系统"。
归根结底,这项研究提出了一个很有挑战性的观点:评估一个AI科研系统,不应该只看它最终产出的数字有多好,而应该看它能不能解释这个数字是怎么来的、声称的机制真的有效吗、哪些情况下有效、哪些情况下无效。这个标准比单纯的性能评估更严苛,但也更接近科学本身的要求。
上海交大团队用XCIENTIST证明了,让AI的科研推理从黑盒变成透明档案,在技术上是可行的。剩下的问题是:这种"可问责的AI科学"能走多远?它还需要什么才能真正大规模地参与到真实的科学发现中?有兴趣深入了解的读者可以通过arXiv编号2606.18874查阅完整论文。
Q&A
Q1:XCIENTIST是什么?
A:XCIENTIST是上海交通大学X-LANCE实验室开发的AI科研系统,核心设计是把AI做科研时的每一步推理过程"外化"为可检查的结构化档案,包括文献依据、创意进化记录、实验合约和消融证据,解决现有AI科研系统"声称漂移"的问题——即最终产出与最初假设之间出现无法追溯的偏差。
Q2:声称漂移(claim drift)具体是什么意思?
A:声称漂移是指AI提出了某个科研假设,但随着代码实现和实验推进,最终产出的系统已经偏离了最初声称的机制,而这种偏差没有被记录或察觉。论文中以AI-Scientist-v2为例,发现其在三类任务中均存在这种情况:要么实现的机制与声称不符,要么缺乏隔离验证某个组件的消融实验,导致性能数字无法归因到具体声称的机制上。
Q3:XCIENTIST的消融实验机制有什么特别之处?
A:XCIENTIST要求对研究提案中每一个规范组件都执行独立的消融实验,且步骤数必须与组件数完全一致,不能省略、合并或改变顺序。每次消融只禁用一个组件,其余保持不变,产生真实执行产物后才能通过验证。消融结果还会以符号记忆的形式反馈给下一轮创意搜索,让系统避免重复提出已被证明无效的机制。
好文章,需要你的鼓励
这项联合研究发现,将Muon优化器应用于强化学习智能体训练时,搭配合适的步骤级信用分配机制,可使任务成功率提升88%,揭示了优化器与评分机制需协同设计的新方向。
本文介绍了CPO方法,通过让AI将自身回答与参考答案对比,在词级别识别推理对错,从而提供比熵更精准的强化学习训练信号,数学推理性能提升高达8.5%。
RAGU是一个多步骤知识图谱增强生成系统,配套7B参数的Meno-Lite-0.1模型,通过两段式抽取和去重整合构建高质量知识图谱,在综合推理任务上超越HippoRAG 2,成本仅为商业API的百分之一。