微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 复旦大学、浙江大学、北京人工智能研究院联手打造:当AI学会在数十张图表之间"寻宝",跨图表问答到底有多难?

复旦大学、浙江大学、北京人工智能研究院联手打造:当AI学会在数十张图表之间"寻宝",跨图表问答到底有多难?

2026-06-29 09:35
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-29 09:35 科技行者

这项由复旦大学、浙江大学、斯坦福大学及北京人工智能研究院联合完成的研究,于2026年6月以arXiv预印本形式发布,论文编号为arXiv:2606.23997。感兴趣的读者可通过该编号检索完整论文。

**研究背景:当AI面对"翻遍资料才能答题"的难题**

每次看新闻或研究报告,你有没有遇到过这样的情况:为了搞清楚某个结论,你得翻开好几张图表,把这里的数字和那里的趋势拼在一起,才能回答一个问题?比如,要判断一个国家的经济状况,你可能得同时看GDP增长图、通货膨胀图和失业率图,然后综合判断。这种在多张图表间穿梭、拼凑答案的能力,对人类来说已经不简单,对AI来说更是一座高山。

现代AI,尤其是那些能看图说话的多模态大模型,已经在理解单张图表方面取得了相当不错的成绩。然而,当问题需要跨越多张图表、从不同来源提取证据并加以综合推理时,现有系统的表现就大打折扣了。更头疼的是,目前学术界评估AI这项能力的"考试题"也不够好——要么只测表格不测图表,要么出题方式太粗糙,导致题目本身就有逻辑漏洞。

这支研究团队敏锐地发现了这个问题,并着手构建了一套名为**ChartWalker**的全新框架,专门用来出"高质量考题",同时也开发了一个基准测试集和一个会主动寻找证据的AI智能体。

---

一、为什么现有的"考题"不够好?

要理解这项研究的价值,先得明白现有的跨图表问答评估存在什么问题。

现有的一类评估工具主要针对结构化表格,而不是真正意义上的图表。表格里的数据是明确排列的,行列分明,就像一份整齐的Excel表;而真实世界中的图表,比如饼图、折线图、柱状图,数据藏在颜色、形状和空间位置里,理解起来远比表格复杂。所以针对表格设计的考题,并不能真正测出AI读图、用图的能力。

另一类更相关的评估工具,比如此前的ChartMRAG,尝试出跨图表的问答题。它的做法是:从每张图中提取几个关键数据点,然后让AI把这些数据点串在一起生成问题。听起来不错,但问题在于,这种做法就像是把两张照片里每人的脸各裁一半,然后硬拼成一张新脸——拼出来的东西往往在逻辑上说不通。

具体来说,一张图说"85%的日本成年人表示家里有墓地",另一张图说"59%的无宗教信仰成年人做过祭祖活动",如果直接把这两条信息拼在一起生成问题,就可能出现这样的题:85%乘以59%的成年人既无宗教信仰又有墓地。但问题是,前一个"85%"指的是所有成年人,后一个"59%"指的是无宗教信仰者这个子集,这两个群体的定义根本不同,直接相乘毫无意义。这种逻辑谬误在学术上被称为"主体不一致",是这类方法的硬伤。

研究团队把这个问题看得非常清楚:出题时如果不弄清楚两张图里的信息是否真的在讨论同一批人或同一件事,生成的问题就会是无效的。

---

二、用"图书馆档案系统"来理解知识图谱

为了解决这个问题,研究团队提出了一个核心创新:**层次化知识图谱**(Hierarchical Knowledge Graph,简称KG)。

知识图谱这个词听起来很技术,但本质上可以理解成一份精细的档案系统。普通图书馆的档案可能只是把书名和作者记下来,但ChartWalker的档案系统要复杂得多——它把每张图表里的每一个"概念"都提取出来,然后标注清楚这些概念之间的关系,并且按照信息的粗细程度,把它们分成不同的层次。

粗略的信息放在顶层,比如"这张图的主题是气候调查";稍微具体一点的信息放在第二层,比如"气候调查按政治立场分了民主党和共和党";更细的信息放在更深的层,比如"民主党中有多少比例的天主教徒持某种观点"。这套分层设计,让不同颗粒度的信息都有了明确的位置,不会混淆。

当这套档案系统覆盖多张图表时,相同的概念就会被识别出来并合并。比如"民主党人"这个概念在100张不同的图表里都出现了,系统就会把它们认定为同一个实体,并记录清楚每张图里关于这个概念的不同信息。这样一来,哪些图里有关于民主党人的哪些信息,就变得一目了然。

值得注意的是,这个"层次"并不是说概念本身有高低之分,而是描述一个概念在它所在的图表里处于什么样的信息颗粒度位置。同一个概念,在一张宏观图里可能处于第二层,在一张专题图里可能处于第一层,两者都是合理的,系统不会强行把它们归为同一层。

---

三、"智能导航":如何从档案系统里找到有意义的出题路径

光有档案系统还不够,还需要一种聪明的方法从这个庞大的系统里找出哪些信息可以组合成一道好问题。研究团队为此设计了一套**结构感知路径采样算法**。

可以把这个过程比作在一座巨大的图书馆里规划一条参观路线。你从某本重要的书出发,沿着主题关联走到相关的书,再走到更细节的资料,最终把这条路线上收集到的所有信息拼凑成一个有意义的问题。

这条参观路线的规划有三个关键原则。

第一个原则是从重要的"枢纽"出发。研究团队用一种改进版的PageRank算法(就是Google搜索引擎早期用来判断网页重要性的核心算法)来选择出发点。不过他们做了一个聪明的修改:在判断一个概念的重要性时,不仅看它连接了多少其他概念,还要看它连接的这些关系来自多少不同的图表来源。一个概念如果只在一张图里频繁出现,那它的"多图跨越价值"就不高;但如果它同时出现在很多不同图表里,那从这个概念出发,就更容易串联多张图表的信息。

第二个原则是保持语义连贯。在路线延伸的每一步,算法都会计算下一个要走到的概念与当前路线的语义相似程度。如果下一步的概念和当前路线讨论的完全是两回事,这条路就会被降低优先级甚至放弃。这就确保了最终采样出来的路径是在讨论同一件事,而不是东一榔头西一棒子。

第三个原则是可控的颗粒度跳跃。路径可以在不同层次的信息之间跳跃:有时候从宏观跳到微观(从"气候调查"走到"民主党天主教徒的具体数据"),有时候在同一层次平移(从"民主党人的气候观"走到"民主党人的宗教构成")。研究人员可以通过调节一个参数来控制这种跳跃的偏好,从而控制生成问题的复杂程度和颗粒度。

路径确定之后,系统会把这条路径上涉及的图表图像和结构信息一起喂给一个视觉语言大模型,由它来生成完整的问答对,包括问题、答案、推理解释和引用来源。为了防止问题里出现"这张图里"这类指代不清的表述,系统特别要求生成的问题必须完全自洽,不依赖任何隐性指代。此外,如果问题文本和图表原文过度雷同,系统还会自动触发改写,以降低"背书式搜索"带来的漏洞。

---

四、考题库长什么样?

基于上述流程,研究团队构建了**ChartWalker-Bench**,一个覆盖806张图表、包含564道多跳问答题的基准测试集。

这806张图表来源广泛,涵盖多种图表类型和主题,经过视觉清晰度和语义丰富度筛选,并通过规则去重。在这些图表上,系统构建了一个包含8802个实体和21436条关系的全局层次知识图谱,共分4个层次。

564道题按难度和类型分成四类。第一类是"事实核查"题,共72道,要求判断某个跨图表的说法是真是假,难度相对最低;第二类是"数值操作"题,共141道,需要用多张图表的数据做加减乘除或排名比较;第三类是"分析"题,共242道,要求发现多图表数据之间的趋势或相关性;第四类是"复杂推理"题,共109道,要求像做逻辑题一样,先定义集合,再判断包含关系,难度最高。

每道题平均涉及2.30张图表来源,推理路径平均有2.81条分支,平均跨越4.52个推理步骤。复杂推理类题目的数据最为震撼:平均涉及3.12张图表,推理跳跃高达5.14步,主观难度评分也是四类中最高的。

生成的原始题目共737道,经过自动质量审核(验证答案是否被证据支持、问题是否有实际意义),通过率为77%,最终保留564道。审核未通过的题目会被丢弃或重新采样,确保最终留下的都是逻辑严密、答案可验证的好题。

---

五、现有AI在这套题上表现如何?

研究团队用多种主流的"检索增强生成"(RAG)方法来测试这套题,结果令人警醒。

所谓RAG,是一种AI答题的工作方式:先从一个大图表库里检索出最相关的几张图表,然后把这些图表的内容喂给一个语言模型来生成答案。这就像开卷考试——先找到相关资料,再作答。

在检索环节,研究团队测试了五种方法。传统的关键词匹配方法BM25的表现最差,在检索前10名时只能覆盖约50%的相关图表。把图表转成文字再做文字嵌入检索的方法稍好。把图表的视觉内容和文字内容统一在同一个向量空间里做检索的视觉语言嵌入方法(VL-Embedding),表现最好,在检索前10时能覆盖约72%的相关图表。图谱类方法中,HippoRAG(一种基于个性化PageRank在知识图谱上扩散相关性的方法)与视觉语言嵌入旗鼓相当,在分析类和复杂推理类题目上表现尤为突出,因为这类题的关键词和图表原文差异较大,纯关键词搜索容易失手。

即便是检索表现最好的方法,前10名里也只能覆盖72%的相关图表——这意味着将近三分之一的关键证据仍然被遗漏,检索远未饱和。

在答题环节,三种规模和开放程度不同的视觉语言大模型(Qwen3-VL-8B、Qwen3-VL-32B和GPT-4o)被用来在检索到的图表基础上作答。即便用最强的GPT-4o搭配最好的检索方法,整体正确率也只有约65%。对于复杂推理类题目,最高正确率仅约51%,而在大多数配置下,这类题目的正确率还不到30%。换句话说,面对最难的跨图表推理题,目前最好的AI系统每三道题里就有两道以上答不对。

规模更大的模型确实表现更好:Qwen3-VL-32B在各类方法下都明显优于8B版本,GPT-4o更进一步。但即使模型变强,图谱类检索方法的价值也没有消失——在GPT-4o下,HippoRAG在最难的分析和复杂推理题上仍然是最好的检索选择,这说明结构化、多跳的证据检索和强大的生成能力是相辅相成的关系,而不是"模型够强就不需要好检索"。

---

六、让AI"主动寻宝":ChartWalker智能体

静态的"检索后作答"方式有其天然局限:它只能检索一次,如果第一次没找对,后面就全错了。为此,研究团队额外设计了一个**ChartWalker-Agent**,让AI能够像一个主动调查的记者一样,在知识图谱上一步一步地搜索证据,随时调整方向。

这个智能体的工作模式可以用寻宝游戏来理解:它从一个起点出发,观察周围有哪些线索,决定是沿着某条关系走向下一个实体,还是先深挖当前实体的某条边,或者退回上一个节点换个方向,直到收集到足够的证据后宣布停止并给出答案。每一步行动产生一个奖励信号,整个过程用强化学习(PPO算法)来训练,让智能体学会在有限步数内高效找到关键信息。

为了避免信息泄露(不能让智能体直接用出题时建好的知识图谱),研究团队专门为智能体重建了一个标准知识图谱,用每张图表的文字摘要作为节点内容。

从测试结果来看,ChartWalker-Agent在105道测试题上,整体正确率(33.14%)略高于最好的静态方法HippoRAG(31.74%),在复杂推理类题目上的提升尤为明显(18.75% vs 15.60%)。

这个结果传达了一个重要信息:对于轻量级的3B参数模型来说,盲目增加检索到的图表数量(从5张增加到10张)并不总是有帮助,反而可能因为图表太多导致模型注意力分散,正确率下降。而让模型主动决定搜索路径,反而能更高效地找到真正有用的证据。

---

七、如何出一道"好题":四类问题类型的设计哲学

研究团队在设计问题类型时,有意覆盖了真实世界中分析师面对多图表时会遇到的不同任务。

事实核查类问题的核心是"这个说法到底是真的还是假的",答案只有是或否,但要给出充分的证据支撑。数值操作类问题则要求从不同图表中取出具体数字,做加减乘除或排序比较,考验的是数字层面的多源整合。分析类问题上升了一个维度,不再是简单的数值比较,而是要发现两个变量之间是否存在相关性或趋势,比如"以色列人对欧盟的好感度,是否与他们对拜登的支持度呈负相关?"这需要同时读懂两张图表并做出综合判断。

最难的复杂推理类问题,则进一步引入了集合论的逻辑运算。比如,先定义"Gtop2"为某国2015年发电结构中份额最高的两种能源,再定义"Ptop1"为某社交媒体平台同年能源消耗中占比最高的能源,然后问:Ptop1是否属于Gtop2?这类问题要求AI理解两张图表的数据、构建集合、再判断包含关系,是纯粹的多步逻辑推理,不是靠直觉就能答对的。

为了让复杂推理类问题更有挑战性,出题时还特别要求降低问题文本与图表原文的词汇重叠度——不能直接出现图表里的关键词,必须用描述性语言迂回表达,这样就堵死了靠关键词搜索"取巧"的路子,逼着检索系统真正理解语义。

---

说到底,这项研究干了一件很实际的事:它发现现有的AI跨图表问答评测工具存在根本性的逻辑缺陷,然后从头设计了一套更严谨的出题体系,并顺手出了564道经过严格验证的考题,还配套测试了目前主流的AI系统。

测试结果很直白:即便是GPT-4o这样的顶级模型,面对最复杂的跨图表推理,错误率依然超过50%。这不是在批评哪个具体的AI产品,而是说明"读多张图表并综合推理"这件事,确实比我们想象的要难得多,现有技术还有相当大的进步空间。

对于普通读者而言,这意味着当你看到AI声称能够自动分析商业报告、科学文献或新闻图表时,应该保持合理的期待:它在单图理解上或许表现不错,但一旦涉及多图交叉比对和逻辑推断,目前的系统仍然会犯不少错误。ChartWalker-Bench的存在,正是为了让研究者能够清楚地衡量这个差距,并朝着弥合它的方向努力。

你可能会好奇:未来的突破会来自更强的模型、更好的检索方式,还是更聪明的智能体设计?这项研究的初步结论是,三者缺一不可。如果你对多模态AI的发展方向感兴趣,检索arXiv:2606.23997可以读到完整的研究细节。

---

Q&A

Q1:ChartWalker-Bench和之前的跨图表问答基准有什么本质区别?

A:ChartWalker-Bench的核心区别在于用层次化知识图谱来出题,保证了不同图表的信息在合并时逻辑一致,不会出现"两个群体定义不同却直接拼凑"的主体不一致问题。此外,它覆盖四种难度递进的问题类型,并对每道题都做了自动答案验证,整体通过率77%,是目前逻辑严谨度最高的跨图表问答评测集之一。

Q2:ChartWalker-Agent和普通RAG系统有什么不同?

A:普通RAG系统是"一次性检索":先找几张图表,再直接作答,找错了就全错了。ChartWalker-Agent则像一个主动调查的记者,它会在知识图谱上一步步游走,每走一步就观察新的线索,决定继续前进还是退回换方向,直到收集够证据才停下来作答。这种主动搜索的方式,在复杂推理题上比静态检索有明显优势,尤其是对轻量模型来说,可以避免"图表太多反而分心"的问题。

Q3:目前最强的AI在ChartWalker-Bench上的正确率是多少?

A:即便用GPT-4o配合最好的检索方法,整体正确率大约是65%,而在最难的复杂推理类问题上,正确率只有约51%。在大多数配置下,复杂推理题的正确率低于30%,说明当前AI在多图表交叉推理方面还有很大的提升空间。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-