微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 当AI模型明明"看见"了,却还是答错:多模态大模型的视觉认知悖论

当AI模型明明"看见"了,却还是答错:多模态大模型的视觉认知悖论

2026-08-19 10:40
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-08-19 10:40 科技行者

你有没有遇到过这种情况:给一个AI模型看一张西瓜的图片,图片里的西瓜瓤是红色的,然后你明确告诉它"只看图片回答,别管你以前学过什么",问它"西瓜通常是什么颜色"。

按理说,这应该是送分题。图片就摆在那里,红色清清楚楚。可结果呢?模型答的是"红色"。

等等,这不就是对的吗?问题恰恰在这里:题目问的是"西瓜通常的颜色",如果严格执行指令去看图片,答案本该是图片里呈现的那个(哪怕它反常识)。但更诡异的翻转版本是这样的:如果你给模型看一张紫色沙漠里矗立着埃菲尔铁塔的图片,让它"只考虑图片"来回答"埃菲尔铁塔周围是什么",它却可能忽略眼前的沙漠画面,直接背出它从海量文本里学到的常识:"铁塔周围是繁华的巴黎街景"。

同一个模型,同一类任务,却表现出两种完全相反的失败模式。一会儿死守着课本知识不肯抬头看一眼黑板,一会儿又对着黑板念念叨叨却假装没听见老师反复强调的重点。这背后到底是怎么回事?这就是哥本哈根大学等机构的研究者们在这篇论文里想搞清楚的事情。

核心问题:是"看不见"还是"不会用"?

先说说背景。

多模态大语言模型*:能够同时理解图像和文字的AI模型,通常做法是把一个预训练好的语言模型(负责"知识"和"推理")和一个视觉编码器(负责"看图")拼接起来,中间用一个投影层做桥接,让视觉信息也能变成语言模型能理解的"词元"。

这类模型有个先天体质问题:它们的语言部分是在海量文本上练出来的,见过的文字比见过的图文配对数据多得多。这就好比一个从小背了几万本百科全书的孩子,突然被要求现场观察一个反常的实验现象。他脑子里装的"标准答案"太多太牢固了,稍不注意就会脱口而出书本上写的东西,而不是眼前真实发生的事情。

早在19世纪,物理学家赫尔姆霍兹就提出过一个观点:人的感知本质上是一种"带着先验信念的推理",眼睛负责提议,大脑里的经验负责拍板。这句话放在AI模型身上似乎同样适用,而且可能是更严重的版本,因为这些模型的"先验知识"是通过千亿级文本硬灌进去的。

那么问题来了,当模型答错的时候,到底是因为它压根没"看清楚"图片(视觉信号在传递过程中丢失了细节),还是它其实看清楚了,只是选择性地不去用这个信息?

这两种可能性,研究者把它们叫做两个假设。

第一个是感知失败假设:视觉通道传递的信息太少,等到要生成答案的时候,视觉证据已经退化了,模型只能退回去用自己脑子里的先验知识。

第二个是使用失败假设:视觉证据其实好好地存在语言模型的内部表示里,但模型没有一套稳定、可控的策略去决定什么时候该听图片的、什么时候该听自己的。

这不是一个无关紧要的区分。如果病根在"看不见",那修复方案应该是升级视觉编码器,让它抓取更多细节。如果病根在"不会用",那再怎么升级摄像头式的编码器都是白费力气,真正要修的是决策机制。这就像看病,如果病人是耳聋,你给他配眼镜是没用的,得先分清楚到底是耳朵坏了还是脑子没处理信息。

传统的多模态评测基准,比如MMBench、MMMU这些常见的测试集,恰恰把这两种可能性混在一起了。一个模型在某道题上答错,你没法判断究竟是它没看清图片,还是看清了但选择用了错误的知识去回答。这篇论文要做的第一件事,就是把这两个假设彻底拆开来验证。

第一步:视觉信息到底还在不在?用"倒推重建"来验证

要证明视觉信息是否真的保留在模型内部,最直接的办法不是问模型问题(因为这仍然依赖模型愿不愿意"说实话"),而是想办法把图片从模型的内部表示里"画"回来。

这个思路很像法医鉴定。你怀疑一份文件被人涂改过,最靠谱的证明方式不是去问涂改者"你改了吗",而是用紫外线或者化学试剂,去检测纸张纤维里是否还残留着原始笔迹的痕迹。如果原始信息真的还嵌在材料深处,哪怕表面看不出来,专业手段也能把它显影出来。

研究者们做的正是这件事。他们拿三个不同家族的模型(Qwen2.5VL、Qwen3.5、Gemma-4)做实验,专门找那些模型在正常提问中回答"全错"的反事实图片,比如一只有着异常腿数的动物。然后他们只用模型最后一层的图像词元(也就是视觉信息经过整个语言模型骨干处理后剩下的那部分表示),去尝试重新生成这张图片。

关键设计在于,训练这个"重建解码器"的时候,只喂给它正常的真实图片,从来没让它见过任何反事实的异常图片。这样一来,如果重建出来的图片里真的出现了那个异常特征(比如多出来的一条腿),就只能说明一件事:这个特征信息确确实实还留在模型的最后一层表示里,不是解码器凭空脑补出来的。

结果相当明确。

**在Gemma-4-E2B-IT、Qwen2.5VL-3B、Qwen3.5-4B三个模型上,重建图像正确还原出反常腿数的比例分别达到了97.8%、93.4%和97.8%。**

也就是说,模型内部其实"看得清清楚楚",异常的细节被完好地保留了下来,只是它在回答问题的时候没有把这些信息用上。

研究者还做了更细致的像素级对比,用IoU(衡量物体轮廓重合度)、PSNR(衡量整体结构保真度)、SSIM(结构相似性)、LPIPS(感知相似度)这几个指标,把重建图和反事实原图、正常真实图分别做比较。结果显示,重建图在所有指标上都更接近反事实版本而不是正常版本,物体的种类、姿态、整体色调都被完好保留,唯一丢失的是高频纹理细节(比如毛发的精细纹理),这一点其实和之前研究已经证实的"视觉编码器会丢弃高频细节"是一致的。

**这个发现意味着一件很重要的事:至少对于粗粒度的视觉属性(比如颜色、数量、大小这类不需要放大镜才能看清的信息),模型看到了,问题不出在感知环节,而是出在后续怎么使用这些信息上。**

第二步:设计一个能真正测出"控制力"的考卷

既然确认了问题出在使用环节,下一步就得设计一个能精确测量这种"使用能力"的测试。

研究者提出了一个叫WhatIfVis的基准测试集,一共3049道人工核验过的题目,覆盖五个维度:空间时间关系、颜色、数量、大小、重量。这些题目被设计成"双面刃"式的问题:同一道题,答案既可以来自图片里的反常内容,也可以来自模型的常识先验,就看你要求它遵循哪一个。

举个例子,图片里画着一匹长了5条腿的马,问题是"马有几条腿"。如果指令是"只看图片回答",正确答案该是"5"。如果指令是"忽略图片,凭常识回答",正确答案该是"4"。

这个设计的巧妙之处在于,它同时测试了两种截然相反的能力:能不能在被要求相信眼睛时真的相信眼睛,也能不能在被要求相信常识时真的调用常识。只有两者都做对,才算这个模型真正具备"可控的视觉上下文敏感性"。

评分标准也有讲究。研究者设计了两种打分方式,一种是严格的精确匹配(模型生成的文字必须和标准答案完全对上),另一种是概率打分(只看模型给两个候选答案的概率排序对不对,不管具体生成的文字格式)。而最核心的指标叫PairAcc(配对准确率),它要求同一道题在两种指令下都答对才算通过,这比传统评测宽松的"平均准确率"严苛得多。

为什么要这么严格?

因为如果只看平均准确率,一个模型完全可能靠"蒙"来得分。比如它无论收到什么指令都固执地回答常识答案,那么在"忽略图片"的那一半题目上它永远拿满分,平均下来的分数看起来还不错,但这根本不代表它有能力"按需切换"。PairAcc把这种作弊空间彻底堵死了,逼着模型必须证明自己真的能听懂指令、真的能按需调用不同的信息源。

结果显示,未经特殊训练的原始模型在这个测试上表现得相当糟糕。

**六个模型(涵盖Qwen2.5-VL、Qwen3.5、Gemma-4三个家族各两种规模)的平均配对准确率只有14.7%。**

而且这种糟糕呈现出明显的任务差异性。在"数量"和"重量"这两类需要推理的任务上,准确率几乎跌到零。在"颜色"这类可以直接从像素读出来的任务上,最强的模型能接近50%。研究者进一步分析发现,模型在空间时间、数量、重量这几类任务上表现出明显的"先验主导"倾向,也就是更相信自己脑子里的知识而不是眼前的图片,尽管它确实感知到了那个反常的视觉信息;而在大小、颜色这两类任务上,模型反而表现出"上下文主导",过度依赖图片内容。

这个发现很好地印证了开头那个西瓜和埃菲尔铁塔的例子:同一个模型,在不同任务类型上,视觉信息的"主导权"完全不稳定,没有一个统一的、可预测的行为模式。

第三步:教会模型"听指令",监督微调能带来多大改善?

既然原始模型不靠谱,那能不能通过训练让它变得可控?

研究者用WhatIfVis里的"空间时间关系"这个子集做训练数据(只用了1136个样本),对六个模型分别进行了监督微调(用的是LoRA这种参数高效微调技术,只调整注意力层里的一小部分参数,而不是重新训练整个模型)。

LoRA*:低秩适应(Low-Rank Adaptation),一种参数高效微调方法,只在模型的部分权重矩阵上叠加一个低秩的可训练矩阵,大幅减少需要更新的参数量,同时保留模型原本的大部分能力。

结果非常鼓舞人心。

**经过微调后,六个模型的平均配对准确率从14.7%跃升到52.7%。**

更重要的是,这种提升不是"死记硬背"式的过拟合。研究者只用"空间时间关系"这一个子集训练,却在完全没见过的"颜色""大小""数量""重量"这几个测试集上都观察到了显著提升,尤其是颜色和空间时间关系两类任务,配对准确率能冲到接近80%。这说明微调教会模型的是一种通用的"能被视觉上下文引导"的能力,而不是针对某个具体任务的应试技巧。

不过,有两类任务顽固地拒绝被"教好":数量和重量。

原因也不难理解。想象一下天平上放着一支铅笔和一个篮球,问"哪个更重"。这个答案不是写在像素里的,你不能靠"看图识字"来解出重量,必须把视觉线索(比如哪边压得更低)和物理常识结合起来做一次推理判断。铅笔天生比篮球轻,这个先验太强了,微调能教会模型"愿意去看图",但如果图里的信息本身不足以直接支撑判断,这种"愿意看"也没处使劲。所以重量任务的提升幅度最小,数量任务虽然从接近零有所回升,但仍明显落后于其他任务。

这背后其实揭示了一个更深的道理:微调能调整的是"该不该信图片"这个决策阀门,但没法凭空生出图片里没有的推理能力。 如果任务需要的信息压根不在像素表面,光靠"更听话"是解决不了根本问题的。

第四步:给模型做"手术",找到决策发生的具体位置

微调解决了行为层面的问题,但研究者还想搞清楚更底层的东西:这个"该信图片还是该信先验"的决策,到底是在模型内部哪个位置做出来的?

这里用到了一个叫激活patching(激活修补)的技术,这个方法最早是从语言模型的可解释性研究里借鉴过来的。

激活patching*:一种因果分析技术,通过把模型某一层在处理A输入时产生的内部激活值,强行替换到处理B输入的对应位置上,观察这种替换是否能让模型的输出行为发生转变,从而定位是哪一层、哪个位置的信息在起决定性作用。

具体操作是这样的:研究者拿两次前向传播做对比,一次是模型被指示"遵循图片"(生成的是ctx答案),一次是被指示"遵循先验"(生成的是pri答案)。然后他们把某一层里最后一个词元位置的注意力输出,从其中一次传播里"移植"到另一次传播里,看这种移植能不能让模型的答案跟着翻转。

这就像医生做脑区功能定位手术。为了确认大脑哪个区域负责语言功能,医生会在病人清醒状态下用微电流刺激不同脑区,观察病人说话是否受到干扰。如果刺激某个特定区域,病人突然说不出话来了,那这个区域大概率就是语言功能的关键节点。激活patching做的事情本质上是类似的:通过"移植"信号,反推出哪一层的计算在决定最终答案的走向。

结果显示,这种"视觉证据vs先验知识"的博弈,确实集中发生在一个相对狭窄的层区间里,而且这个区间在不同模型架构里的具体位置各不相同。比如在Qwen3.5-9B上,这个决定性区间大概在第13到21层;在Gemma-4-E4B上,则落在第20到27层左右。研究者测试的六个模型横跨三种完全不同的注意力设计(标准Transformer、线性注意力混合架构、逐层嵌入设计),发现的规律都是一致的:博弈发生在一个窄的、循环出现的层带里,但具体深度是架构相关的。

也就是说,这个"该听谁的"的决策不是分散在整个网络里做的,而是集中在某几层完成的,这是一个跨架构都成立的普遍现象,只是每个"手术室"的具体楼层号不一样。

第五步:一根"操控杆",不用下指令也能调整模型行为

找到了决策发生的位置之后,研究者更进一步:既然这个决策是二元的(要么听图片,要么听先验),那能不能用一个一维的向量来直接操控它?

这个思路借鉴了此前在纯文本语言模型上的研究(Minder等人2025年的工作),叫做可控上下文敏感性(Controllable Context Sensitivity, CCS)框架。研究者把它扩展到视觉场景,称为可控视觉上下文敏感性(CVCS)。

具体做法是,在已经确定的关键层里,学习一个单位向量u,这个向量代表了"遵循图片"和"遵循先验"这两种状态之间的差异方向。推理的时候,不需要在提示词里写任何"请只看图片"之类的指令,直接把模型在这一层的内部表示沿着这个向量方向"拨动"到一个特定的标量值,就能让模型的行为发生对应的偏转。

这就好比给一台老式收音机装了一个新旋钮。以前你想换台,得对着说明书念叨半天频率数字(相当于写复杂的提示词指令),现在只需要伸手拧一下旋钮,收音机就直接切到你想要的频道,不需要任何语言描述。

效果如何呢?

**这个不需要任何指令的操控向量,把六个模型的平均配对准确率从原始基线的14.7%提升到了37.7%。**

这个数字虽然还没达到监督微调的52.7%(毕竟微调调整的是整个权重矩阵,而这里只动了一个方向),但已经明显超过了"写指令但不做任何内部干预"的原始基线表现。这说明视觉上下文敏感性这件事,确实可以被压缩进一个可操控的低维空间里。

研究者还做了一个对照实验,验证这个提升不是"瞎蒙"来的。他们用一个随机初始化的、同样是一维的方向去做同样的操控,结果准确率反而跌到只有5.9%,比什么都不做的基线14.7%还低。这说明关键不在于"随便找个方向去扰动模型",而在于这个方向必须是通过优化学出来的、真正对应"视觉vs先验"这个语义轴的方向。乱拨旋钮不会让收音机换台,只会让它变成一堆噪音。

第六步:文字和图片,谁更容易被"控制"?

最后,研究者还做了一个饶有趣味的对照实验:既然WhatIfVis的每张反事实图片都配了一句描述同样内容的文字(比如"埃菲尔铁塔周围是沙漠"),那如果把视觉输入换成文字输入,模型的表现会不会不一样?

需要说明的是,这个文字版本的设定是直接把反事实内容"说出来"了,相当于给模型划了重点,所以这更像是一个"上限参考",而不是完全公平的对照,但它足以揭示一个问题:模型控制文字上下文和控制视觉上下文的难度,差距有多大?

结果相当悬殊。

**在原始基线上,图片渠道的配对准确率只有14.7%,而文字渠道达到43.4%,差距接近29个百分点。而且这个差距不会随着模型变大而缩小,反而越拉越大。**

比如Qwen2.5-VL从3B升级到7B,图文差距从9.1个百分点扩大到20.6个百分点;Qwen3.5从4B升到9B,差距从18.0扩大到55.8个百分点;Gemma-4从2B升到4B,差距从26.8扩大到41.5个百分点。模型越大,越擅长处理文字指令,但在处理图片指令时的进步却慢得多。

研究者进一步拆解发现,这个差距几乎全部来自"遵循证据"这一半的能力,而不是"忽略证据"那一半。具体来说,"忽略证据、调用先验知识"这件事,图片和文字两个渠道表现几乎一样(差距不到1个百分点),说明模型压根不需要多余的信息就能调用自己的知识库,这个能力和输入形式无关。但"遵循证据、按图索骥"这件事,文字渠道成功率高达73.9%,图片渠道只有45.7%,差了整整28.2个百分点。

这说明模型真正的短板,是没法像听懂一句话那样"听懂"一张图片传达的具体内容,即便这张图片里的信息已经确认被完整保留在了模型内部。 这也进一步验证了整篇论文的核心结论:不是视觉信息丢了,是模型"听不懂"图片在说什么,或者说,不愿意像信一句话那样去信一张图。

写在后面

读完这篇论文,最触动我的不是那个14.7%的低分,而是那个97.8%的重建准确率放在一起对比时产生的落差感。

一个模型,内部清清楚楚地记着一匹马有五条腿,问它的时候却坚持说四条。这不是记忆力问题,是一种奇怪的"选择性沉默"。这让我想起人有时候明明知道某件事是真的,却因为某种社会性直觉而不愿意说出口,只不过这里的"社会性直觉"换成了训练数据里几十亿次重复出现的"马有四条腿"这个统计规律。

论文里那个"数量"和"重量"任务怎么都训不好的细节,我觉得比主线结论更值得琢磨。它暗示了一件事:可控性和推理能力可能是两个完全独立的维度。你可以教会一个模型"愿意看图",但如果任务本身需要在看图之后再做一步推理(而不是直接读出答案),这种"愿意"派不上用场。这提醒我们,未来想让模型真正学会"看图说话再推理",恐怕不是简简单单调整它信谁不信谁的开关就够了。

还有一个问题这篇论文没有回答,但我很好奇:如果模型的先验特别强、图片证据又特别弱的时候(比如图片很模糊,反事实内容不那么明显),这根"操控杆"还灵不灵?会不会存在一个信息量的临界点,低于这个点,无论怎么拨动那个向量,模型都拉不回来?

Q&A

Q1:WhatIfVis是什么?

A:WhatIfVis是论文提出的一个基准测试集,包含3049道人工核验的题目,覆盖空间时间关系、颜色、数量、大小、重量五个维度。每道题的图片内容和文字问题都是反事实设计的,答案可以来自图片本身,也可以来自模型的常识先验,专门用来测试模型在两者冲突时的行为倾向。

Q2:多模态大模型答错问题,到底是因为看不清图片,还是不会用看到的信息?

A:论文通过图像重建实验证明,粗粒度的视觉信息(比如物体数量、颜色、大小)确实完整保留在模型内部表示里,重建准确率高达93%到98%。所以答错的根本原因不是感知失败,而是模型没有稳定的策略去决定什么时候该用这些视觉信息。

Q3:能不能不写复杂指令,就让模型按需选择相信图片还是相信自己的知识?

A:可以。论文通过激活patching技术定位到模型内部决策发生的具体层,然后学出一个一维的操控向量,推理时直接调整这个向量的数值就能控制模型的行为倾向,不需要在提示词里写任何指令,效果比完全不干预的原始模型明显更好。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-