微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 一台机器能看懂显微镜下的原子沉积图吗?ICDAR 2026比赛揭晓答案

一台机器能看懂显微镜下的原子沉积图吗?ICDAR 2026比赛揭晓答案

2026-08-19 10:09
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-08-19 10:09 科技行者

你有没有想过,芯片是怎么造出来的?

答案藏在一个叫原子层沉积的技术里,科学家们一层一层地往硅片上叠原子,薄到只有几纳米,这项技术支撑着你手机里的芯片、电脑的处理器,甚至未来的量子计算机。

搞这个研究的科学家,每天要面对成堆的实验图表:反应速率随温度变化的曲线、材料成分的光谱图、能带结构的示意图。这些图表信息密度极高,一张图里可能藏着好几个关键结论。人类专家看一眼就懂,但机器呢?

2026年,一群研究者做了一件挺较真的事:他们想知道,现在最先进的AI模型,到底能不能看懂这些专业到发指的科学图表。于是就有了这场比赛,ICDAR 2026 Sci-ImageMiner竞赛。

结果有点出乎意料。AI在给图表分类、写摘要这类"看图说话"的任务上表现相当不错,但一旦涉及从图表里抠出精确数据,或者回答需要深度推理的问题,就开始频频翻车。这篇文章想跟你聊聊,这场比赛到底测出了什么,又暴露了AI理解科学图表的哪些软肋。

这件事到底难在哪

先说清楚一个背景。

原子层沉积和原子层刻蚀,英文缩写是ALD和ALE,是半导体制造里的核心工艺技术,简单说就是像搭积木一样一层原子一层原子地往材料表面添加或去除物质,精度能达到原子级别。这两个领域的科研论文里,图表是信息的主要载体,很多关键结论根本不会写进正文文字,全靠图说话。

在这场比赛之前,已经有不少数据集尝试让AI理解科学图表,比如面向真实世界图表的ChartQA,或者合成数据集PlotQA。但这些数据集要么图表种类太单一,要么任务设计太简单,离真实科研场景差得远。材料科学领域也有一些专门数据集,但覆盖的图表类型有限,任务形式也比较单薄。

这就好比什么呢?

假设你想训练一个新人快速看懂医院的各种检查报告,但你手头的教材只有验血报告一种类型,还只教他认"数值是否超标"这一个技能。等他真上岗,遇到CT片、心电图、病理切片,立刻抓瞎。之前的科学图表数据集大概就是这个状况:类型窄,任务浅,一旦拿去应对真实科研场景里五花八门的复杂图表,立刻露怯。

Sci-ImageMiner想解决的就是这个问题。研究团队从205篇ALD/ALE领域的真实科研论文里,提炼出49种图表类型的完整分类体系,涵盖折线图、分子结构图、光谱图、能带图、相图等等,几乎把这个领域会用到的图表类型一网打尽。

这个数据集不是随便找几个学生标注了事。团队招募了10名具备研究生到博士后学历的领域专家,专门做标注工作。为了衡量标注质量,他们计算了Fleiss' Kappa值,一种统计学指标,数值在0到1之间,越接近1说明不同标注者的判断越一致,他们测出来的分数是0.46,属于中等一致的水平

这个数字挺诚实的。0.46不算特别高,恰恰说明了这类任务本身就有相当的主观性和难度,连专业人类之间的判断都存在分歧,更别说让机器去学了。

四道题,一道比一道难

比赛设计了四个递进的任务,像是给AI设置了一场从简单到复杂的升级考试。

第一关是分类任务。给AI一张图,让它从49个预定义类别里选出正确答案。这个任务听起来简单,做起来却暗藏玄机,因为很多图表类型长得极其相似,比如"多光谱图"和"堆叠光谱图"之间的区别,可能只有资深研究者才分辨得出来。

第二关是数据提取。这个任务要求AI把图表里的数据"抠"出来,重建成结构化的Markdown表格格式,相当于把一张折线图倒推还原成背后的原始数据表。

这里有两个评价指标值得说一下。

相对映射相似度(RMS)和树编辑距离相似度(TEDS)*:前者衡量提取出的数据点和真实数据点之间数值上的接近程度,后者衡量生成的表格结构和标准答案表格结构之间的差异程度,数值越小说明结构越接近。最终得分是两者各占一半权重加权算出来的。

第三关是摘要生成,要求AI针对图表写出简洁但信息准确的文字总结,考验的是从视觉信息到自然语言的转换能力。

第四关,也是难度最高的一关,是视觉问答,英文缩写VQA。这一关彻底放弃了自动化标注,全部由人类专家手工设计问题和答案。为什么要这么较真?因为团队希望这些问题真正考验"理解"而不是"识别"。

问题设计参照了布鲁姆认知分类法的修订版本,这是教育心理学里一套用来衡量学习深度的经典框架,从"记住"到"理解"再到"应用""分析""评价""创造",层层递进。团队按这个框架把问题分成四类:流程导向型问题问反应机制和实验步骤,比较趋势型问题问数量关系和相关性,结构性质型问题连接化学成分和最终材料性能,应用性能型问题把实验现象和实际器件表现挂钩起来。

举个具体例子。论文里给出了一张能带图,配的问题是"随着锗含量增加,导带预计会如何变化?"这不是简单地读数,而是要求AI理解材料科学里的物理规律,知道锗掺杂会怎样改变半导体的电子结构,然后用连贯的语言把这个因果关系解释清楚。

这已经不是"看图识字"了,是真正的科学推理。

答案类型也分了四种:是非题只需要判断对错,事实型答案要求简短精确的事实陈述,列表型答案是几个并列的答案项,段落型答案则要求给出详细解释性的回答。这种分层设计让评价标准可以针对不同答案类型分别打分,更公平也更精细。

图表和文字,怎么变成机器能学的东西

数据准备阶段,团队用了一个叫MinerU的开源工具,把论文PDF里的文字内容提取成结构化的JSON格式,同时把图片提取成高分辨率的JPEG文件。这一步保证了后续处理时,文字的语义结构和图片的视觉细节都不会丢失。

标注这么复杂的四层任务,现成的标注工具根本不够用。团队干脆自己开发了一套基于网页的多用户标注平台,支持在子图级别做精细标注,还带边界框坐标定位功能。

有意思的是标注流程里的一个巧妙设计:分类、数据提取、摘要这三个相对"客观"的任务,先用一个叫Qwen2.5-VL-7B-Instruct的多模态AI模型做预标注,生成初步答案,再由人类专家核对修改。

这就好比批改作文之前,先让一个学生打个草稿,老师在草稿基础上修改,而不是从零开始写。这样能大幅提高标注效率。但视觉问答任务因为对推理深度要求太高,团队干脆放弃了AI预标注这条捷径,完全交给人类专家从零设计问题和答案,确保这部分数据的推理质量不被AI的偏见或错误污染。

这个取舍挺值得琢磨。如果视觉问答也用AI预标注会怎样?大概率会导致问题设计得过于表面,答案也可能带着AI自己的知识盲区和错误,最后训练出来的模型学的是AI教AI,而不是真正的专家知识。省下的标注时间,可能换来的是数据集本身质量的天花板变低。

最终整个数据集包含205篇论文提取出的1951张图表,按照ALD和ALE两大类,再细分为实验研究和模拟研究四个子类,划分成训练集、验证集、测试集。训练集有1180张图,验证集201张,测试集570张,规模不算特别庞大,但胜在标注质量高、任务设计全面。

统计下来,数据集里出现频率最高的图表类型是多线图,占比15.31%,其次是分子结构图,占13.77%,普通折线图占11.16%。这个分布也侧面反映了材料科学论文里常见的视觉表达习惯,大量实验结果需要用多条曲线的对比来呈现趋势变化。

比赛现场:68人,1263次提交

比赛从2025年11月28日官网上线开始筹备,2026年1月9日正式进入开发阶段,训练数据分批次逐步放出,3月6日完整的训练/验证集和盲测数据集才全部公开,评估阶段则持续到4月8日结束。

整个比赛吸引了68名活跃参与者,累计提交了1263次公开和私有结果。这个规模对于一个高度垂直的细分领域数据集来说,已经相当可观。分类任务的参与热度最高,有81名参与者提交了501次结果,数据提取任务53人提交335次,摘要任务43人提交212次,视觉问答任务47人提交215次。

比赛用了CodaBench这个平台管理提交和自动评分,为每个任务单独开设赛道,避免了人工评审带来的效率瓶颈和主观偏差。

谁赢了,靠什么赢的

先看分类任务的战况。

夺冠的团队叫Ricoh_SRCB,他们的思路挺有意思。他们没有直接训练一个"一步到位"分49类的模型,而是先训练一个粗粒度的6类模型,把图表先分成大类,再在此基础上训练精细的49类模型,还额外加了针对特别容易混淆类别的辅助分类器,最后把几个模型的判断结果融合起来。推理阶段他们还同时输入整张图和局部裁剪的图,让模型既能看到全局构图,又能捕捉局部细节。

这个策略像什么呢?

想象你要教一个刚入职的博物馆讲解员认出上百种古董瓷器的窑口,如果一上来就让他死记硬背一百种花纹的细微差别,大概率记混。更聪明的做法是先教他粗分几个大类,官窑、民窑、外销瓷,再在每个大类里精细区分具体窑口。如果不这样分层,直接让新手在浩如烟海的细节里硬记,准确率大概率会打折扣,因为人脑(和AI模型)处理信息都有认知负荷上限,一次性塞进太多平行的判断维度,反而互相干扰。

排名第二的方案来自另一支参赛队,他们换了个思路,把分类问题重新定义成"生成"任务。具体做法是用LoRA技术微调Qwen2.5-VL-7B-Instruct模型。

LoRA*:全称Low-Rank Adaptation,一种参数高效微调技术,不需要重新训练整个大模型的所有参数,只调整其中一小部分低秩矩阵,大幅降低训练成本,同时保留原模型大部分已学到的知识。

这支队伍让模型直接根据图片和一段带有分类体系描述的文字提示,生成对应的类别标签文字,而不是走传统的"分类头"路线。他们还用了测试时增强和多数投票机制来提升预测的稳定性。

分类任务最终成绩显示,冠军团队Ricoh_SRCB拿到了0.79的准确率和0.81的F1分数,而作为对照基准的开源模型Gemma 4 E4B 8b只有0.67的准确率和0.68的F1分数。差距超过10个百分点,说明专门针对任务微调过的模型,确实比通用大模型直接上场要强不少。

数据提取任务的冠军是TeleOCR-VL团队,他们的策略是把"看懂图表结构"和"识别具体数值内容"这两件事拆开单独训练,再用大规模合成数据来补足标注数据不够的问题,推理阶段还引入了多模型集成投票。

RMS和TEDS的加权得分上,TeleOCR-VL拿到41.81分,是所有团队里最高的。作为对比,基线模型Qwen 3 VL 8b只拿到35.97分。这个任务的整体分数普遍不算太高,反映出从图表里精确提取结构化数据,对当前的AI模型来说依然是块难啃的骨头。

摘要任务里,DeepVitminC团队夺冠,他们搭了一个模块化框架,包含一个"上下文提取模块"和一个"一致性对齐模块"。

RAG*:检索增强生成技术,全称Retrieval-Augmented Generation,让模型在生成回答之前先从外部资料库里检索相关信息,再结合检索结果生成答案,而不是完全依赖模型内部记忆的知识。

他们用RAG技术从论文原文里检索图注等相关文字信息,注入模型输入,让生成的摘要有据可依。这个思路挺朴素但很有效:不是让AI凭空猜图里讲了什么,而是让它先"翻书"确认背景信息,再动笔总结。

如果不做这一步会怎样?模型很可能会编造一些貌似合理实则捕风捉影的总结内容,毕竟纯粹靠图像本身,很多专业术语和数值背景是猜不出来的。

摘要任务最终得分,DeepVitminC以0.56的加权分获胜,基线模型Intern VL 3.5 8b只有0.48分。这个任务的整体表现是四个任务里相对较好的,说明当前的多模态模型在"总结归纳"这类相对宽松的生成任务上已经有了不错的基础能力。

视觉问答任务同样是DeepVitminC夺冠,加权得分0.31,而基线模型Molmo2 8b只有0.2分。这个任务的绝对分数是四个任务里最低的,直观反映出深度推理确实是当前AI最大的短板。

DeepVitminC采用的方法是基于规则提取图注和周边文字作为上下文信号,通过RAG增强的提示词工程,再结合面向对齐的模型微调,让输出更贴合语义要求。

数据说话:AI到底强在哪,弱在哪

把四个任务的结果放在一起看,能看出一个挺清晰的规律。

分类和摘要这两个相对"表层"的任务,AI表现相对不错,准确率和加权得分都能到0.7以上、0.5以上的水平。但数据提取和视觉问答这两个需要"深挖细节"或者"深度推理"的任务,分数明显偏低,数据提取任务最高分也就41.81(满分100),视觉问答最高分只有0.31(满分1)。

这个反差挺说明问题的。

打个比方,这就像考试里的选择题和论述题。选择题只要模型见过类似的图表模式,凭感觉大概能选对,毕竟选项已经框定了范围。但论述题要求你从图里精确抠出每一个数据点,或者结合专业知识做出符合逻辑的推理判断,这时候模型如果没有真正"理解"图表背后的物理化学原理,就只能靠蒙,蒙对的概率自然骤降。

比赛报告里还专门总结了几个团队通用的成功经验。

第一,几乎所有排名靠前的团队都用了Qwen系列的开源视觉语言模型作为基座,尤其是Qwen2.5-VL-7B-Instruct和Qwen3.5-9B这两个版本,说明这些模型的视觉理解底座相对扎实,微调空间也比较大。

第二,几乎所有成功方案都不是"单纯堆一个大模型硬解"的思路,而是设计了精细的流程管线,包括把上下文信息(比如图注、论文原文段落)注入到提示词里,用数据增强手段解决类别不平衡问题,以及采用集成或多智能体的方式让多个模型判断相互校验。

第三,一些团队尝试了DPO这种偏好对齐技术。

DPO*:Direct Preference Optimization的缩写,直接偏好优化,一种让语言模型学习"人类更喜欢哪个答案"的训练技术,不需要单独训练一个复杂的奖励模型,直接用偏好数据优化模型输出。

Ricoh_SRCB团队用DPO配合LoRA微调,专门构造了"硬负样本",也就是把正确答案做随机扰动生成的错误版本,拿这些扰动样本训练模型区分好坏答案,效果比单纯用弱模型生成的错误答案更好。这个细节挺值得琢磨:有时候教AI"什么是错的",比单纯喂"什么是对的"更能提升判断力,就像教小孩认字,光背对的字形不够,让他对比着看常见的错别字反而记得更牢。

不过也不是所有花哨的技术都管用。VLMinators团队在报告里坦诚地写道,他们尝试对多个不同架构的模型做集成,结果发现效果反而变差,原因是不同模型之间的判断分歧太大,集成反而互相拖后腿。这个反例挺珍贵,说明"堆更多模型"不是万能药,模型之间如果本身判断逻辑差异过大,简单投票融合可能适得其反。

这场比赛到底告诉我们什么

回到比赛设计之初提出的三个问题。

现在的多模态AI模型到底能不能看懂专业科学图表?答案是:能看懂表面,但看不透深层。分类和摘要这类相对宏观的任务,AI已经能达到不错的水平,但一旦涉及精确数值提取或者需要结合领域知识做推理判断的任务,表现就明显掉链子。

哪些方法策略真正有效?答案是:context context context。几乎所有获胜团队都不约而同地往模型输入里塞进了额外的文字信息,图注、论文正文段落、甚至是前置任务的输出结果。这说明纯粹依靠视觉信息,对当前的模型来说还是不够的,文字背景信息能显著弥补视觉理解的不足。

哪个任务最难?数据提取和视觉问答,尤其是视觉问答里的深度推理部分。这也恰好呼应了另一篇被引用的研究提到的观点,视觉语言模型在感知层面表现不错,但在科学推理层面依然力不从心。

这场比赛某种意义上像一次公开的"压力测试"。它没有藏着掖着说AI已经能替代人类专家读懂科研图表,而是老老实实地把AI的强项和弱项都摆在台面上。

值得一提的是,这个比赛的后续影响已经开始显现。比赛结束后,获胜团队被邀请把方法整理成正式论文,提交到会议论文集,这意味着这些方法论细节会被完整地记录和公开,供后来者参考复现。

再往前追溯,这场比赛也是站在之前研究基础上的。比如更早的ICDAR比赛聚焦化学结构识别,或者MacBench这个针对化学材料科学的多模态基准测试,都在为"AI能不能读懂专业科学内容"这个大问题添砖加瓦。Sci-ImageMiner把范围收窄到ALD/ALE这个具体的半导体材料领域,换来的是标注质量和任务设计深度的大幅提升。

写在后面

读完这篇论文,有个细节让我反复琢磨。

标注一致性只有0.46,中等水平。这不是团队没做好,恰恰相反,这个数字诚实地暴露了一件事:连人类专家去判断"这张图该归为哪一类""这个问题该怎么问才算深度合理",都存在明显分歧。我们总以为专业领域的判断应该是黑白分明的,但现实是,连专家之间的共识都没有那么牢固。

这让我想到一个更根本的问题:如果人类专家自己对"什么算深度理解"都没完全统一意见,我们又凭什么要求AI做到完美一致的判断?也许"让AI理解科学图表"这个目标本身,需要先重新定义清楚"理解"到底意味着什么程度的一致性。

另一个让我意外的地方是集成学习失效的那个案例。多个模型投票在很多场景下是常规操作,但这次有团队明确报告说效果变差了。这提醒我,技术圈里很多"最佳实践"其实是场景依赖的,不是放之四海皆准的公式。

如果未来两三年内,数据提取任务的准确率能从现在的40分左右提升到70分以上,那意味着什么?可能意味着实验室里那些堆积如山的图表数据,真的可以被自动化地转成结构化数据库,供后续检索和二次分析。这件事一旦发生,材料科学研究的效率会发生什么样的变化,值得继续追问下去。

Q&A

Q1:Sci-ImageMiner竞赛具体测试了AI的哪几项能力?
A:竞赛设置了四个任务,分别是图表分类(识别图表属于49种类型中的哪一种)、数据提取(从图表中还原出结构化数据表格)、摘要生成(用文字总结图表核心内容)、以及视觉问答(回答需要领域知识和推理能力的问题)。

Q2:为什么视觉问答任务的AI得分明显低于其他任务?
A:因为视觉问答要求AI结合材料科学专业知识进行深度推理,而不只是识别图表类型或提取表面数据。比赛结果显示,这个任务的最高加权得分只有0.31,是四个任务里表现最差的,说明当前多模态AI在科学推理上仍有明显短板。

Q3:获胜团队普遍用了什么技巧提升AI的表现?
A:几乎所有排名靠前的团队都在输入里额外加入了论文原文、图注等文字上下文信息,并采用了LoRA、QLoRA等参数高效微调技术,部分团队还用了DPO偏好对齐或多智能体协作的方式,来弥补纯视觉理解的不足。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-