
你有没有想过,一个AI要做科研,到底缺的是什么?
大部分人的第一反应是:算力不够,或者模型不够聪明。但2026年这篇论文给出的答案完全不一样。它说,现在那些能自动写论文、自动跑实验的AI科学家系统,其实workflow已经很完整了,从提想法到写论文的每一步都能自动化。真正缺的,是它们压根没看过真正的实验数据。
这句话第一次读到时会觉得奇怪。AI处理数据不是天经地义的事吗?但仔细想想就明白问题在哪了。现在大多数AI科学家系统看到的不是原始的病理切片图像、不是原始的地震波形,而是别人已经提前处理好的一串数字、一个表格、一段文字描述。
这就好比让一个侦探破案,但你不让他去现场,只给他一份别人写好的案情摘要。摘要里说"死者胸口有伤",但侦探没法判断伤口的形状、深度、方向,这些细节可能恰恰是破案的关键。如果案情摘要漏掉了某个细节,侦探永远也想不到去问那个问题。AI科学家系统面对的正是这种处境:它们的"案情摘要"是人类提前挑选、简化过的特征向量,而原始证据里那些真正决定性的空间结构、时间顺序、跨通道关联,早就在压缩成摘要的过程中丢掉了。
这篇论文的作者来自新加坡国立大学和牛津大学,他们给这个系统起了个名字,叫OmniScientist。
感知不足是怎么发生的
先说清楚一件事:科学证据的形态五花八门。
有些是符号化的东西,比如公式、代码、知识图谱,这些东西天生就是给文字和逻辑处理的。但另一类证据完全不同,比如显微镜照片、声波频谱、三维CAD模型、动物迁徙轨迹,这些东西携带的是空间关系、时间关系、跨通道关系,是那种没法简单用一句话说清楚的结构信息。
*感知层(Perception Layer)*:系统里专门负责让AI"看懂"原始证据的模块,它会把图像、信号、音频、视频、三维结构等不同形态的数据组织起来,交给AI去观察和分析,而不是直接喂给AI一堆提前算好的数字。
论文里有一个特别直观的例子,说的是三个学科的对比。地震学里,三通道地震波记录的是波的到达时刻是否一致、粒子运动是否稳定,这些线索藏在波形的细节里。病理学里,染色切片记录的是组织纹理是否均匀、细胞密度是否随位置变化。三维CAD设计里,零件的几何形状记录的是主轴方向、表面和空洞的分布。
这三类证据如果被压缩成一个标量特征向量,会发生什么?
论文给出了答案:结构关系全部丢失,研究问题的空间也跟着变窄。具体来说,如果地震波形被简化成几个统计量,你就永远不可能注意到"这段被标记为噪声的信号里其实藏着一个规律的到达和衰减包络"这种细节,因为那种包络形状本身就是靠"看"才能发现的东西,而不是靠几个数字能推断出来的。
这就像给一个厨师只提供菜谱上写的调料清单,却不让他尝味道。清单上写着"盐、糖、酱油",但真正决定这道菜好不好吃的,是火候、是食材新鲜度带来的那种细微差别,这些东西根本没法写进清单。如果厨师只靠清单工作,他永远做不出真正好吃的菜,因为他连自己做错了什么都不知道。
论文把科学证据分成四大类,这个分类不是按学科分的,而是按"需要什么样的推理方式来理解"分的。
*四大证据家族*:感知类(图像、视频、显微照片、雷达、音频、三维结构,需要空间和模式识别);符号类(自然语言文档、公式、序列、知识图谱,需要逻辑和语义推理);量化统计类(表格、测量数据、分布、相关性,需要统计推断);程序动态类(实验步骤、代码执行记录、仿真轨迹,需要过程性推理)。
这个分类方式挺有意思的,它说明同一个引擎理论上可以处理地震图、CAD网格、生物知识图谱,只要给它配上合适的感知工具。这也是这篇论文敢说自己"omni-discipline"(全学科)的底气所在。
一个引擎,三个自主agent
OmniScientist的核心架构不复杂,说白了就是感知层加上三个agent,分别负责想点子(ideation)、跑实验(experiment)、写论文(writeup)。
这三个阶段各自内部用的是ReAct循环。
*ReAct循环*:一种让AI交替进行"观察-推理-行动"的工作模式,AI看到一点信息,想一想该做什么,然后采取行动,再观察结果,如此循环,而不是一次性把所有步骤想好再执行。
这个设计乍一看平平无奇,但真正的巧思藏在阶段之间的过渡上。论文里反复强调一件事:阶段内部的推理是开放的,让AI自由发挥;但阶段之间的转换是确定性的,由代码强制检查,不是靠AI自己判断"我做得够好了吗"。
这个区别为什么重要?因为大语言模型有个众所周知的毛病,叫幻觉,也就是它可能编造一个听起来很像真的但实际上没发生过的结果。如果让AI自己决定什么时候可以进入下一阶段,那就相当于让学生自己批改自己的考卷,他当然会给自己打高分。
所以这篇论文设计了三道关卡,分别叫idea check(想法检查)、rigour check(严谨性检查)、claim check(声明检查),每一道都是用代码写死的判断逻辑,不是靠AI打分。
*idea check*:检查想法阶段的输出是否完整,包括是否有清晰的研究问题、假设、实验草案和证伪标准,是否做了至少3次针对性的文献检索,是否自我筛选过至少5个候选想法,提出的方案是否能完全靠代码执行(不需要物理实验)。
这里有个细节值得展开说说。论文提到,系统会自动把AI写的"首次""从未被研究过"这类过度自信的措辞,改写成"基于本次检索,该方向似乎尚未被充分探索"。
这个小小的语言修正背后其实是一种谦逊的态度设计。想象一下,你让一个刚入职的新员工去做市场调研,他花了半天时间搜索了几个关键词,然后自信满满地说"我们是第一个想到这个点子的公司"。任何一个有经验的领导都知道这句话大概率是错的,不是因为这个员工不认真,而是因为半天的搜索根本不足以支撑这么绝对的结论。如果系统不做这个修正,AI写出来的论文里会充斥着经不起推敲的过度断言,一旦被审稿人抓到就是硬伤。
实验阶段的检查更严格。论文给出了一段伪代码,叫Algorithm 1,专门用来防止两类科研作弊行为:编造数据,以及事后找理由(HARKing)。
*HARKing*:全称是Hypothesizing After the Results are Known,指的是先看到实验结果,再假装这个结果是提前预测好的,这在科研伦理里是明确禁止的行为,因为这会让"巧合"被包装成"发现"。
这道检查逻辑长这样:如果报告的结果里没有指标,拒绝;如果代码执行记录里没有一次成功运行,拒绝;报告里出现的每一个数字,必须能在真实的程序输出里找到对应,否则拒绝;如果报告里有两个以上的p值,必须对所有跑过的测试(包括被否决的)做多重比较校正;最关键的一条,如果最终拿出来当headline的结果不在"被支持的分析"列表里,直接拒绝,这就是防止HARKing的关键一招。
这套机制解决的核心矛盾是什么?是"探索的自由度"和"结论的可信度"之间的张力。一个真正做科研的人,得允许自己去尝试很多可能性,大部分尝试会失败,只有少数会成功。但如果最后写论文的时候,把失败的都藏起来,只挑成功的说,那这个"成功"很可能只是噪音里的偶然。这篇论文用代码把这道防线焊死了,不管AI多聪明多会说话,它都绕不过这道检查。
数据也证明了这套机制确实在起作用。论文统计了36个案例里检查机制实际拦截了多少次不合格的提交,总共115次拒绝,其中87次发生在实验阶段,单一个原因就占了51次,叫做"demotion",意思是AI试图把一个不显著的分析结果包装成正式发现,被系统拽了回去重新处理。这说明什么?说明如果没有这道检查,四分之一以上的实验结论可能是不靠谱的。
写论文这件事,也不能一套模板打天下
写论文阶段有个细节挺打动人的。论文提到,如果只用一套模板,不管什么学科的论文读起来都会像一个味儿。
所以系统准备了5种结构模板,机器学习论文要有Related Work和Limitations两节,生物医学论文要把Methods放在最后,化学论文喜欢把Results和Discussion合并写。这个模板由任务规格文件指定,或者由AI根据研究主题自动推断,和研究领域本身是解耦的。
*结构解耦*:意思是"用什么模板写"这个决策和"研究的是什么内容"是两件独立的事,系统可以让同一个底层引擎,分别用地震学的行文习惯写一篇地震研究,用材料学的行文习惯写一篇材料研究,不会因为换了学科就要重新写一套系统。
写作过程本身也是逐段生成的,每一节只能用被分配给它的那部分实验记录来写。这个设计防止了一个常见问题:方法部分不该突然跳出来一个从未提到的实验细节,结果部分不该出现方法部分都没交代过的数字。摘要是最后写的,基于同样的记录,所以摘要里的数字和正文肯定是一致的。
这里其实反映了一个更深的问题。写论文这件事,表面上是文字工作,但骨子里是信息组织的工作。如果一个作者(不管是人还是AI)在写方法部分时,脑子里同时装着结果部分的所有数字,他很容易"知道答案往回写",让方法显得比实际上更有针对性。而如果严格限定每一节只能接触被分配的那部分证据,反而更接近真实的科研叙述逻辑,先有方法,再看结果,而不是反过来。
36个案例,5大学科,4类证据
光讲设计理念没有说服力,得看实际效果。
论文构建了一个36案例的demonstration suite,涵盖5个学科大类:物理科学、地球与空间科学、生命与医学、农业与生态、工程与信息科学。每个案例都用一个真实的、可公开下载的数据集,横跨图像、信号、音频、视频、三维结构、轨迹、表格、公式、图谱等12种模态。
结果是,36个案例全部走完了从原始数据到编译好的PDF论文的完整流程,一个都没有失败。
用Claude Sonnet 5作为主推理引擎,生成论文的综合评分是6.3分(满分10分),这个分数是由两个跨系列的AI评委(deepseek-v4-flash和gemini-2.5-flash-lite)打出来的。
论文还测试了9种不同的推理引擎backbone,包括GPT-5.6、GLM-5.2、Kimi K2.7,还有几个开源小模型比如Qwen3.5系列(9B到122B参数)和Gemma-4系列。有意思的是,GLM-5.2拿到了6.5分的最高分,Kimi K2.7紧随其后6.2分,反而比GPT-5.6的5.6分还高。这说明什么?说明这个框架的设计本身相当鲁棒,不完全依赖某一个特定的顶级模型才能跑得动。
但是小模型的表现就明显掉队了。Qwen3.5-9B只有4.0分,Gemma-4-26B也才4.2分,和Sonnet 5的6.3分之间差了2个多点。论文进一步拆解了这个差距具体体现在哪:factual accuracy(事实准确性)和soundness(严谨性)这两个维度,在最强和最弱的模型之间差了2.9个百分点,而multimodal grounding(多模态贴合度)这个维度,反而是最不敏感的,只差1.2个点。
这个发现挺反直觉的。你可能会觉得,模型越弱,应该是感知能力先掉链子,毕竟"看懂图片"听起来是个很吃模型能力的任务。但实际情况是,因为感知模型被单独固定成Sonnet 5,不随推理backbone变化,所以不管换哪个模型做推理,拿到手的感知结果质量是一样的。真正随着推理backbone强弱而剧烈波动的,是那个模型能不能把看到的东西严谨地组织成一篇有逻辑的论文。这其实提示了一个设计经验:感知能力和推理能力最好分开评估,不然你很难判断问题到底出在"看不懂"还是"想不清楚"。
下面这张表格总结了几个关键backbone的详细表现:
| 推理引擎 | 完成案例数 | 综合评分 | 事实准确性 |
|---|---|---|---|
| **Claude Sonnet 5** | 36/36 | 6.3 | 7.7 |
| GLM-5.2 | 17/18 | **6.5** | 7.5 |
| Kimi K2.7 | 6/9 | 6.2 | **8.0** |
| GPT-5.6 | 9/10 | 5.6 | 7.7 |
| Qwen3.5-122B | 30/34 | 5.1 | 6.5 |
| Qwen3.5-9B | 18/32 | 4.0 | 4.8 |
| Gemma-4-26B | 25/34 | 4.2 | 5.1 |
值得一提的是,factual accuracy这个维度在所有backbone里普遍是最高分的那一列。这不是巧合,论文解释说这是因为不管哪个引擎在跑,那道claim check(声明检查)的代码逻辑是死的,它逼着每一个被报告的数字都必须能在真实执行记录里找到出处。这就好比考试的时候,不管学生水平高低,都得把计算过程写清楚,答案对不上过程的直接判错,这样一来即使学生粗心大意,至少不会出现凭空编造答案的情况。
有没有感知,到底差多少
这篇论文最核心的实验设计,是拿一个"盲版"系统来对比。
*盲版系统(Blind variant)*:一个只接收预先计算好的标量特征、从不接触原始观测数据的对照系统,用来模拟传统的纯文本AI科学家系统的工作方式。
论文挑了5个案例,让完整版OmniScientist和盲版在完全相同的任务上跑一遍,然后让评委做头对头比较,谁写的论文更好。为了排除评委的位置偏好,论文还专门把两篇论文的呈现顺序随机打乱。
结果是,有感知能力的完整版赢得了85%的头对头对比。
拆开看每个维度,提升最大的是multimodal grounding,涨了2.8分,其次是significance(研究重要性),涨了1.8分。而factual accuracy在两个版本里几乎一样高,这个符合预期,毕竟两边都要过同一道provenance(溯源)检查。
这个结果说明感知带来的好处,不是让论文"看起来更花哨",而是真正扩大了这个研究能够支撑的结论范围。论文里给了一个特别具体的对比例子,是关于地震学案例的。盲版系统只能看到特征名字这种文字描述,它设计的实验方案居然需要用到实际录音里根本不存在的字段,导致后来不断地被迫返工重新规划。而有感知能力的版本,直接从波形本身观察出一个可执行的假设,一次到位。
这就好比两个人被要求评价一部电影好不好看。一个人拿到的是别人写的剧情简介和几个评分标签,另一个人是真的坐在影院里看完了整部电影。前者可能会根据"悬疑""高分"这些标签,煞有介事地分析这部片子悬疑感够不够强,但如果简介里没提到某个反转镜头的具体拍法,他永远也想不到从这个角度去评价。后者却能凭直接的观察发现前者根本注意不到的细节。如果不亲眼去看,你永远不知道自己漏掉了什么。
论文还专门统计了评委打平局的比例,发现在multimodal grounding、significance、novelty这三个维度上,评委几乎从来不打平局,说明这几个维度上两个版本的差距特别明显、容易分辨。但在factual accuracy和reproducibility(可复现性)上,大约四分之一的比较结果是平局,这恰好印证了前面说的,这两个维度受同样的溯源检查约束,天然更容易拉平。
两个案例,看AI科学家真的"看"出了什么
论文用两个具体案例来展示这套系统的实际发现能力,读起来特别有意思。
第一个案例是审计STEAD地震数据集。这是一个包含大约1500条三分量宽频带地震波记录的目录,一半标记为地震,一半标记为噪声。系统在直接观察原始波形时,发现一条被明确标记为"噪声"的记录里,居然藏着一个清晰的起始和衰减包络,而理论上噪声记录应该只有平稳的背景震动。
系统没有直接推翻数据集的标签,而是把这个矛盾转化成一个具体的研究问题:到底有多大比例的"噪声标记"记录,实际上携带了真实的瞬态信号?
这个问题的提出方式本身就值得停下来想一想。它没有说"这个标签是错的",而是说"让我量化一下这种矛盾有多普遍"。这种谨慎的态度,恰恰是idea check那道检查逼出来的:不能过度自信地断言,只能基于观察提出可检验的问题。
系统接着自主设计了一个综合检测器,结合振幅、直线性、平面性以及跨通道一致性这几个指标,把阈值设在三个独立空模型的第99百分位上。最终结论是:750条噪声标记的记录里,163条(21.7%)携带了一致的、有极化特征的跨通道瞬态爆发信号,95%置信区间是[18.8%, 24.9%]。
更进一步,系统还做了一个消融实验,把跨通道一致性这个判断条件去掉,检测率立刻从21.7%塌陷到只有2.0%,这说明"多个通道同时出现异常"才是这个现象背后真正的判断依据,而不是单纯的振幅大小。这个估计还在50倍的虚警率范围、3种不同的空模型、4种窗口选择,以及跨越417个不同台站的聚类自举检验下都保持稳定。
第二个案例是儿科胸部X光片研究。系统拿到的只是标注了"正常"或"肺炎"的正面胸片,没有任何预先计算的特征。系统直接读片,发现肺炎患者的肺野不是均匀变亮,而是呈斑块状,密集的区域和清晰的区域相邻分布。
系统把这个视觉观察转化成一个可测量的量,叫滑窗局部香农熵图的空间离散度,并提前定义了假设:这种斑块状不均匀性能够独立于整体熵水平,区分出正常和肺炎两类。
结果显示,这种空间不均匀性以相当大的效应量(Cohen's d超过1.2)区分开正常和肺炎肺野,而且这个效应在开发集和留出测试集上都稳定存在。在多变量模型里,这个空间指标在平均熵之外还提供了显著的协同增益,最终在留出测试集上取得了0.851的AUC峰值,大幅超过原始像素基线的0.634。
这个发现的形成过程本身就是一个很好的证明。要提出"空间异质性"这个概念,必须先真正地、视觉上地观察到X光片的这种质感,这是一个纯文本挖掘系统根本无法完成的归纳步骤,因为它需要先"看见图案",再"想到用什么数学量去刻画这个图案",这个顺序反过来是走不通的。
消融实验:每个组件到底值多少分
论文还专门做了一次leave-one-out(留一法)的组件消融实验,拿地震学案例来测,每次去掉一个组件,看分数怎么变。
结果显示,prior-art search(文献查重)和迭代式agentic循环是最关键的两个组件。去掉文献查重之后,综合分数从6.9掉到5.7,原因很直观,因为系统开始容易提出重复的、已经被发表过的想法。把迭代循环压缩成单次通过,论文质量同样明显下降。
novelty check(新颖性检查)这个组件的作用比较specific,单独去掉它,novelty这一维度直接掉了整整1分,但对综合分数影响不算特别大,说明它精准地对应着自己该管的那个维度。
至于provenance enforcement(溯源强制机制),论文说它起作用的层面和其他组件不一样。因为它是代码层面的确定性约束,不直接改变评分标准看到的叙述性文本,所以从纯粹的评分角度看不出明显变化,但它的真正价值在于从数学上保证每一个报告出来的实证声明都可以被溯源验证,这是一种隐性但根本的保障,不会体现在肉眼可见的分数波动上。
这篇工作接下来的路
论文最后提到,添加一个新的学科,只需要写一份新的规格文件,核心引擎完全不用改动,也不需要写任何领域特定的代码。这个设计思路本身,值得单独说一说。
*可扩展性设计*:意味着这套系统的架构复杂度不随学科数量线性增长,新增一个学科的边际成本几乎为零,理论上可以覆盖任意学科,只要能把该学科的证据整理成规格文件描述的格式。
论文附录里给出了一份完整的地震学任务规格文件样例,里面只包含四个字段:角色(agent扮演什么身份)、研究对象、目标属性、开放式请求,加上一份原始数据的文件路径清单。这份文件里完全没有出现任何方法论、假设或分析步骤的描述,系统读到这份文件时,也不会把它当作一个特殊案例来处理。
这个设计思路让我想起软件工程里"关注点分离"的经典原则,但用在科研自动化这个场景里格外有说服力。因为它证明了一件事:让AI理解一个新学科所需要的,不是重新训练一个新模型,也不是重写一套新代码,而是把这个学科的证据用统一的方式组织起来,交给同一套感知、想点子、跑实验、写论文的循环去处理。
当然,论文也没有回避局限性。整个36案例的demonstration suite,虽然覆盖面很广,但毕竟每个学科只有几个到十几个案例,离真正大规模、系统性验证还有距离。而且这套系统目前处理的都是纯计算型的研究,idea check里明确规定"提出的方案必须能完全靠代码执行,不能需要物理实验",这意味着真正需要湿实验室操作的科研环节,这套系统目前还碰不到。
Q&A
Q1:OmniScientist和其他AI科学家系统最大的区别是什么?
A:其他系统大多只能处理文字、代码、标签或者别人提前算好的数字摘要,而OmniScientist能直接读原始数据,比如地震波形图、病理切片照片、三维CAD模型,让这些原始证据里的空间结构、时间顺序、跨通道关系全程参与研究提问、实验设计和结论撰写,而不是在处理数据的第一步就被压缩丢掉。
Q2:OmniScientist是怎么防止AI编造实验结果的?
A:系统在关键节点设置了代码写死的检查关卡,不靠AI自我判断。比如要求报告的每一个数字必须能在真实程序输出里找到对应,如果最终当作亮点结论的分析不在"被支持的分析"列表里,直接拒绝提交,逼着AI重新处理,这套机制在36个测试案例中实际拦截了115次不合格提交。
Q3:有没有感知能力,对生成论文的质量到底差多少?
A:论文做了对照实验,让有感知能力的完整版和只能看预先计算特征的"盲版"系统跑同样的任务,结果完整版赢得了85%的头对头对比,其中提升最明显的是多模态贴合度(涨了2.8分)和研究重要性(涨了1.8分),说明感知能力带来的不只是论文更好看,而是真正扩大了研究能够支撑的结论范围。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。