微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 上海人工智能实验室等机构证明:让AI直接"看"论文原图,比读文字更聪明

上海人工智能实验室等机构证明:让AI直接"看"论文原图,比读文字更聪明

2026-07-22 16:10
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-22 16:10 科技行者

这项研究由上海人工智能实验室联合中国科学技术大学、浙江大学和上海交通大学共同完成,于2026年7月发表,论文编号为arXiv:2607.09657,有兴趣深入了解的读者可通过该编号查询完整论文。

你有没有想过,当一台AI在学习物理课本时,如果只给它看课本上的文字,而把所有图表、公式排版、示意图统统扔掉,它还能学得好吗?多年来,训练大型AI语言模型的标准做法,恰恰就是这么干的——把一本本科学文献的PDF转换成纯文字,然后喂给AI。这篇研究的出发点,就是质疑这个几乎从未被人挑战过的默认假设。

研究团队将他们的方法命名为"视觉预训练"(Visual Pretraining,简称VP),与之对应的传统方法叫"文字预训练"(Text Pretraining,简称TP)。他们的核心发现是:在完全相同的文献素材上,直接让AI"看图"学习,比先把图转成文字再让AI读文字,效果更好,而且还更省资源。这听起来几乎像是一个反直觉的结论——毕竟AI语言模型不是一直都在处理文字吗?但实验数据相当清晰地指向了同一个方向。

一、科学论文里藏着文字无法还原的知识

考虑这样一个场景:你拿到一篇量子力学论文的PDF,然后用软件把它转成纯文本。原本整齐排列、层次分明的数学公式,可能变成了一串混乱的字符;原本一目了然的能级跃迁示意图,彻底消失了;原本通过图表对比呈现的实验数据,变成了零散的数字。这种转换是有代价的——而且代价不小。

认知科学领域早就有研究指出,人类在思考时,不只依赖语言,还大量依赖图形、空间布局和符号拓扑结构。一个物理学示意图的价值,并不仅仅在于图旁边的文字说明,而在于它所呈现的几何关系、因果箭头、变量之间的视觉关联。当你把这张图转换成文字时,这些关系就像沙堡遇上海浪,大部分都消失了。

研究团队将这种现象称为"文字化损失"。科学论文中的视觉元素——公式的排版方式、表格的结构、图示的空间组织——本质上是对知识的另一种编码方式,与文字编码是互补的,而非冗余的。现有的AI训练流程,却把这一整套互补编码直接丢弃了。

与此同时,机器学习领域近年出现了一个叫做"柏拉图表征假说"的理论,大意是说:不同的AI模型,无论是处理文字的还是处理图像的,它们内部对世界的表征方式,最终会趋向于某种共同的底层结构。这个理论暗示,图像和文字其实在描述同一个现实,而从图像中学习,理论上可以获得与从文字中学习互补的知识。视觉预训练正是在这个思路上迈出了实践的一步。

二、同样的论文,一个读文字,一个看原图

为了公平比较,研究团队精心设计了一个"同源对照"实验。他们准备了一批科学PDF文献,然后走两条路:第一条路,用MinerU2.5这款文档解析软件把PDF转成文字,大约得到800亿个文字词元(可以粗略理解为800亿个"字"),然后用这些文字训练AI;第二条路,把完全相同的PDF页面直接渲染成图片,过滤掉空白边距等无效区域,只保留有实际内容的"前景图块",大约只得到200亿个视觉词元,然后用这些图像内容训练AI。

两条路使用完全相同的文献素材,使用完全相同的基础AI模型作为起点,使用完全相同的后续微调步骤,唯一的区别就是:一个AI学的是文字,另一个AI学的是原始图像。

这种精心设计的对照,确保了实验结论的干净:任何性能差异,都只能归因于"表征方式"的不同,而不是学习材料的不同。

在训练过程中,视觉预训练的具体机制是这样运作的:冻结的视觉编码器(可以理解为AI的"眼睛",在训练过程中不被修改)把每一张文档图片转化为一系列视觉特征向量(可以理解为对图像各个区域的数字描述)。然后,AI语言模型的主体通过一个叫做"下一个视觉潜变量预测"的任务来学习:给定前面若干个图像区块的特征,预测下一个图像区块的特征。这个任务的逻辑,与语言模型预测下一个词的逻辑完全一致,只不过预测的对象从离散的文字变成了连续的视觉特征向量。

具体的损失函数采用了一种叫做InfoNCE的对比学习目标:在一批预测结果中,每个预测都要与它对应的真实下一个视觉特征尽量靠近,同时与批次中其他无关的视觉特征尽量远离。这就像一道选择题,AI不只要说出正确答案,还要同时否定所有干扰选项。整个训练过程中,语言模型主体、视觉投影模块和预测头都在更新,而视觉编码器始终保持冻结,为AI提供稳定的视觉特征"靶标"。

训练时,文字学习和视觉学习是交织进行的,最终的损失函数是两者的加权和,两个权重都可以调整,相当于在说:"同时从文字和图像中学习,各自占一定比重。"

三、实验结果:视觉预训练在四款顶级AI上全面领先

研究团队在四款当前最先进的大型AI模型上进行了测试,覆盖了两类架构:原生多模态模型(Qwen3.5和Llama 3.2 Vision,本身就能处理图像)和纯语言模型(Qwen3和Llama 3.1,本身只处理文字)。测试的评测基准涵盖了四个方向:MMLU-Pro(考察跨学科知识广度)、GPQA Diamond(研究生级别的科学推理,号称"谷歌防作弊问答")、AIME 2025(美国数学邀请赛,考察高难度数学推理)和HLE(人类最后考试,考察极端困难的多步骤推理)。

所有测试都以文字形式进行,也就是说,最终评测时AI读的是文字题目,输出的是文字答案。这一点非常关键:视觉预训练提升的是AI的语言推理能力,而不只是让AI更善于理解图片。

结果显示,在Qwen3.5这款多模态模型上,视觉预训练相比文字预训练,GPQA Diamond提升了3.05个百分点(从76.24到79.29),MMLU-Pro提升了1.18个百分点(从83.91到85.09),AIME提升了0.63分(从89.58到90.21),HLE提升了0.97个百分点(从15.70到16.67)。在Llama 3.2 Vision上,GPQA提升了2.84个百分点(从30.24到33.08),AIME提升了4.79分(从13.75到18.54),提升幅度尤为显著。在两款纯语言模型上,同样呈现了一致的提升趋势,Qwen3的GPQA从74.94提升到77.08,Llama 3.1的GPQA从43.88提升到47.10。

HLE这个基准的提升幅度相对最小,研究团队对此给出了合理解释:HLE的难度主要来自极端复杂的多步骤推理,而不是依赖科学文献中的视觉知识。换句话说,视觉预训练主要帮助AI获取那些被文字转换丢失的知识,而不是凭空增强推理深度。

四、只用四分之一的词元,效果却更好

除了性能提升,研究团队还发现了一个令人意外的效率优势。回忆一下前面说的:文字预训练用了约800亿个词元,视觉预训练只用了约200亿个词元,后者的词元用量仅为前者的四分之一。尽管如此,视觉预训练的性能却全面超越了文字预训练。

这种效率差异从哪里来?核心原因在于,科学文档的视觉表示本身就是一种高度压缩的信息编码。一张展示实验结果的图表,可能只占几百个视觉图块,但如果要把图表中的所有信息完整地用文字表达出来,需要几段乃至几页文字。视觉预训练直接对这种高密度编码的原始形式进行学习,不需要先把信息"解压"成文字再学习,节省了大量词元预算。

研究团队还做了更细致的消融实验,探究视觉词元数量和图像渲染分辨率对性能的影响。在视觉词元数量方面,他们测试了从0.25倍到4倍的预算范围,发现1倍设置(每批次保留8192个前景视觉词元)是性能最优的甜蜜点。过多的视觉词元反而会因为对比学习中批次内负样本数量增加、有效梯度尺度改变等优化层面的原因,导致性能略微下降。在图像分辨率方面,他们发现即使把最大分辨率从1120降低到560,性能损失也非常有限,视觉预训练在低分辨率下仍然明显优于文字预训练。这进一步说明视觉预训练的优势来自对文档结构的整体理解,而非对像素细节的死记硬背。

研究团队还绘制了性能随训练词元数量增加的变化曲线,发现视觉预训练的收益增长速度明显快于文字预训练。具体而言,以文字预训练相对基线的提升为参照,视觉预训练在MMLU-Pro上达到了1.27倍的归一化增益,在GPQA上达到2.02倍,在AIME上达到2.88倍。也就是说,用更少的词元,获得了更陡的学习曲线,这在AI训练中是相当罕见的特质。

五、结构越密集,视觉预训练越占优势

研究团队还做了一项颇有洞察力的分析:按照文档页面的"视觉结构密度"对评测样例进行分类,然后分别统计不同密度下视觉预训练相对文字预训练的优势大小。视觉结构密度简单来说就是一个页面上有多少公式、图表、示意图等非纯文字内容,依照Masry等人的方法划分为低、中、高三个层级。

结果非常直观:在低密度(基本上是纯文字页面)的样例上,视觉预训练和文字预训练的性能几乎持平,差值约为-0.15,可以忽略不计。在中密度样例上,视觉预训练领先约2.86分。在高密度样例(充满公式、图表、示意图)上,视觉预训练领先高达3.80分。

这个规律完美印证了研究的核心逻辑:文字转换过程中丢失的,正是那些在视觉上有意义的结构——方程式的拓扑排列、表格的行列关系、图示中的方向性箭头。这些东西越多,文字化的损失就越大,视觉预训练的优势就越明显。低密度页面由于本来就以文字为主,文字转换几乎没有损失,两种预训练方式自然不分伯仲。

此外,研究团队还发现,视觉特征预测的质量与下游任务的提升幅度之间存在明确的正相关:AI在预测下一个视觉图块特征时越准确(用余弦相似度衡量),最终在多模态评测基准上的性能提升也越大。这种联系说明,视觉空间的建模质量,是视觉预训练能够发挥作用的根本原因,而不是某种难以解释的随机现象。

六、没有图文配对标注,多模态能力也自然涌现

视觉预训练还带来了一个额外的惊喜:在完全没有使用任何图文配对标注数据的情况下,AI处理多模态任务的能力也提升了。这意味着,视觉预训练的好处不仅仅停留在语言推理层面,还会渗透到AI理解图像内容的能力中。

研究团队从Qwen3.5模型中提取了100对科学文档的图像-文字配对样本的内部表示,然后用多种指标衡量视觉表示和文字表示之间的"相容性",也就是说,当AI处理同一篇文档的图像版本和文字版本时,它内部对这两个版本的理解有多接近。

结果显示,经过视觉预训练之后,全局层面的"质心分离度"(两种模态的平均表示之间的距离)从1.665骤降至0.661,降幅接近60%;配对样本的余弦相似度(同一文档的图像表示和文字表示有多相似)从0.631上升到0.907。结构层面,线性CKA(衡量两种表示的几何结构是否相似)从0.657上升到0.745。局部层面,互相最近邻重叠度(同一文档的图像和文字在各自的"邻居圈子"里有多少重合)在所有测试的k值下都显著提升,在最严格的k=1设置下从0.140提升到0.310,翻了一倍有余。这些数字共同描绘了一幅清晰的图景:视觉预训练重塑了AI内部的表示空间,让图像和文字的理解在某种共同的内部语言中更好地对齐了。

在多模态基准测试上,视觉预训练同样全面领先。以Qwen3.5为例,MMMU-Pro(多学科多模态理解)从基线72.14(文字预训练)提升到73.87,SFE(科学家首次考试)从53.09提升到56.57,ChartQAPro(图表问答)从56.42提升到61.80,MathVista(视觉数学推理)从85.50提升到86.70。文字预训练在ChartQAPro上甚至出现了相对基线的退步(从57.99降到56.42),说明进一步的文字训练反而无助于、甚至损害了对视觉密集型任务的处理能力,而视觉预训练则恰恰在这类任务上优势最为突出。

研究团队还额外做了一项图像到文字检索的测试:给定一张文档图片,让AI在100篇文档文字中找出对应的那一篇。文字预训练模型的R@1准确率(找到正确文档的概率)为64%,而视觉预训练模型的准确率跃升至99%。原来那种AI常见的"某些文字被当作万能答案"的"枢纽现象"(少数几篇文字不论输入什么图像都容易被选中,因为它们的内部表示太中庸,所以与很多输入都距离不远),在视觉预训练后几乎消失了,说明AI内部的图文对应关系变得更加精确和有区分度。

七、AI注意力揭示的视觉推理机制

研究团队还做了一个定性分析,试图理解视觉预训练为何能帮助AI做数学题。他们取了同一道数学题,分别以纯文字形式和图像形式输入到Qwen3.5,然后提取AI在生成最终答案时对前面内容的注意力分布——也就是说,AI在写出答案的那一刻,最关注的是哪些部分。

在文字模式下,AI对原题的约束条件和中间计算步骤给予了高度关注,而对填充性文字几乎不理会。在视觉模式下,AI的注意力集中在图像中对应这些语义区域的位置——同样是约束条件和中间计算步骤所在的区域,而非无关区域。两种模态的注意力模式呈现出相当程度的对应关系,说明视觉预训练让AI学会了从文档图像中识别和关注推理所需的关键证据,与纯文字推理时使用的证据在语义层面是对齐的。

研究团队谨慎地指出,这个分析只是支持性证据,不能据此得出文字推理和视觉推理在内部使用完全相同机制的结论。但它至少说明,视觉预训练确实让AI在处理视觉文档时,能够把注意力引导到语义上有意义的位置。

八、是否需要像素级重建?答案是不必要

研究团队还探索了一种"更强"的视觉预训练变体:给AI加装一个生成式解码器,不只预测视觉特征向量,还要把文档图像的像素完整地重建出来,从而获得像素级别的监督信号。这个变体的逻辑很有吸引力——像素级监督更细致,理论上应该让AI学到更多细节。

然而结果却出乎意料地让人冷静:加装了生成式解码器的版本,在语言推理评测基准上的性能,与不带解码器的简洁版本基本持平,甚至在部分指标上略逊。而代价是训练成本上升了约30%到40%,整个训练管线也复杂得多(需要额外约3亿参数的解码器,以及额外的扩散风格潜变量损失和像素级MSE损失)。带解码器的版本达到相同收敛标准需要约1.4倍的训练时间。

这个结论说明,对于下游语言推理任务而言,像素级的重建精度并不是AI需要从文档中学习的关键。AI需要的是文档的结构和语义,而这些在视觉特征向量层面就已经被充分捕获了,无需下沉到像素层面。这反过来也证明了简洁版视觉预训练的设计是合理的。

归根结底,这项研究讲的是一件相当反常识的事:当AI学习科学知识时,直接看原始文档图片,比读从图片里提取出来的文字,学得更好,用的"字数"还更少。这个发现挑战的,是整个AI大模型训练领域多年来一个几乎没人认真质疑过的默认做法——把所有文献都转成文字再学习。

对普通人来说,这项研究最直接的意义或许是:未来的AI,在回答物理、化学、数学等科学问题时,可能会因为在训练时"见过"而非"读过"相关文献,而给出更准确的答案。一个AI如果在学习过程中真正理解了一张物理示意图的空间结构,而不只是读了对这张图的文字描述,它在面对类似问题时的表现理应更好——而这项研究的实验结果,正是对这个直觉的系统性验证。

当然,研究团队也坦诚了几个局限。视觉预训练并非独立于语言预训练,它是在语言预训练基础上的补充延伸,而非替代。研究主要针对科学文献这类知识密度极高、图文紧密耦合的文档类型,是否对自然照片、视频等更广泛的视觉内容同样有效,目前还不清楚。此外,视觉预测损失和文字损失之间的协调调度方式,也还有很大的探索空间。这些都留给了未来的研究去回答。

Q&A

Q1:视觉预训练和传统文字预训练的根本区别是什么?

A:传统文字预训练会先用工具把PDF文献转成纯文本,再用这些文字训练AI,这个过程会丢失公式排版、图表结构、示意图的几何关系等视觉信息。视觉预训练则直接把PDF页面渲染成图片,过滤掉空白边距后,让AI通过预测下一个图像区块的视觉特征来学习,从而保留了文字化过程中会丢失的结构性知识。两者使用完全相同的文献素材,差别只在于信息的呈现形式。

Q2:视觉预训练为什么能提升AI回答文字问题的能力?

A:科学文献中的很多知识本来就是通过视觉形式编码的——公式的拓扑结构、图表的因果关系、示意图的空间组织。当这些内容被转成文字时,这些关系大部分会丢失。视觉预训练让AI直接从原始图像中学习这些结构性知识,相当于获取了文字化路径无法传递的信息。实验证明,在科学推理评测中,视觉结构越密集的题目,视觉预训练的优势越明显,这直接支持了"是视觉结构知识起了作用"这一解释。

Q3:视觉预训练需要图文配对的标注数据吗?

A:不需要。视觉预训练完全是无监督的,训练过程中AI只看未加任何标注的原始文档图像,没有人工标记的图文对应关系,也没有描述图像内容的文字标签。尽管如此,经过视觉预训练后,AI处理多模态任务(如图表问答、视觉数学推理)的能力也显著提升,说明无监督的视觉学习自然地改善了AI内部图像与文字表示的对齐程度。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-