微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 当AI看图说话时,它真的在"看"吗?

当AI看图说话时,它真的在"看"吗?

2026-08-20 15:43
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-08-20 15:43 科技行者

你有没有想过这样一个问题:一个多模态大模型,明明眼前摆着一张高清图片,为什么有时候回答问题时,感觉根本没怎么"看"图,全靠猜?

这不是一个玄学问题。2026年初,一群来自新加坡国立大学和慕尼黑大学的研究者们,就在这个看似简单的现象背后,挖出了一个此前被整个领域忽视的大坑。他们给这个现象起了个名字,叫做"模态失衡"。而围绕这个发现,他们造出了一套新方法,叫OPD-V,让一个只有4B参数的小模型,干翻了参数量是它一百倍的对手。

这事说起来挺魔幻的。故事得从"自蒸馏"这个技术讲起。

先搞懂:什么是"在线自蒸馏"

要理解这篇论文在解决什么问题,得先明白现在训练多模态大模型(MLLM)的一种主流套路。

多模态大模型:能同时理解图片和文字,并进行推理问答的AI模型,比如你熟悉的GPT、Gemini这类能"看图说话"的AI。

这类模型训练到后期,光靠人工标注答案去"喂"已经不够了,因为模型自己生成的答案和标准答案之间总有些细微的分布差异没被捕捉到。于是研究者们想出一招,叫"在线自蒸馏"。

在线自蒸馏(OPSD):让模型自己先生成一段回答,然后用同一个模型的"教师版本"(通常是参数滑动平均得到的副本),在模型自己走过的每一步上重新打分,把这个更精细的打分结果反过来教模型,让它学会给自己纠错。

这个方法巧妙在哪?它不再是让模型死记硬背标准答案,而是在模型自己犯错的地方,给它一个更靠谱的参考。这个"教师"因为可以看到一些训练时才有的"特权信息"(比如标准答案),所以打分会比学生自己更准。

打个比方,这就像你写完一篇作文,老师批改的时候手里有一份参考范文。老师不会直接把范文抄给你,而是在你写的每一句话旁边,标注"这句话按范文的思路应该更倾向于表达什么"。你自己写的句子还是你自己的,但每一步都被悄悄纠偏了。如果没有这个参考范文,老师批改的时候也只能凭自己的经验瞎猜,纠偏的准头就差远了。

问题来了,这个"参考范文"(也就是特权信息)该怎么构造才最有效?

领域里已经有的尝试,以及被忽略的坑

在OPD-V出现之前,已经有不少团队在琢磨怎么给这个"教师模型"喂更好的特权信息。

有的方法叫Vision-OPD,做法是把图里和问题最相关的区域裁剪放大,喂给教师模型看,让教师"看得更清楚"再打分。还有Visual-OPSD,往教师那边塞一些额外的"视觉思考过程"。VA-OPD和VCSD则换了个思路,通过改变教师能看到的视觉内容来制造对比。

这些方法的共同点是,它们都在想方设法让教师模型的输入更丰富、更有针对性。但这篇论文的作者们发现了一个致命盲点:所有这些精心设计的特权信息,都默认了一个前提,就是模型会好好利用这些视觉线索。可现实是,这个前提往往不成立。

模态失衡:指多模态大模型在生成回答时,过度依赖文字上下文(比如问题本身的措辞、语言习惯),而没有真正整合利用图片里的视觉信息,哪怕这道题本来就需要看图才能答对。

这就像你请了一个手艺高超的美食顾问,专门给你挑选最新鲜的食材,切配得漂漂亮亮端到你面前。可你炒菜的时候压根没看那盘菜,全凭自己脑子里对"这道菜大概长什么样"的记忆和经验去下锅调味。顾问挑的食材再好,你不看它,它就白瞎了。如果不解决这个"看不看"的问题,那些精心设计的特权信息,最后都成了摆设,教师给出的高质量打分信号,学生根本没吸收进去。

用两个"教师",把模态失衡这件事测出来

研究者们没有直接假设模态失衡存在,他们先做了个实验,把这件事实实在在地测出来。

他们设计了两个对照组的教师。一个叫正向教师,看的是放大聚焦版的图片,也就是把和问题相关的区域裁剪并放大,让视觉线索格外突出。另一个叫负向教师,看的是遮挡版的图片,把放大图里的一块区域用黑色像素挡住,人为削弱视觉信息。而学生模型本身,看的是原始的完整图片。

正向教师(Zoom-In Image / Positive Teacher):接收放大聚焦图的教师模型,图中任务相关区域被裁剪放大,视觉证据更加突出。

负向教师(Mask Image / Negative Teacher):接收遮挡图的教师模型,图中部分区域被黑色像素遮挡,视觉信息被人为削弱。

这三种"看图"条件下,模型内部到底更依赖视觉还是依赖文字,研究者用一个指标去衡量,叫模态平衡注意力比率。

模态平衡注意力比率:衡量模型在生成回答时,投给视觉信息的注意力和投给文字信息的注意力的比值,数值越高说明模型越依赖视觉而不是纯靠文字脑补。

实验结果非常清楚。负向教师(看遮挡图)的这个比率最低,是0.148。学生(看原图)居中,是0.226。正向教师(看放大图)最高,达到0.263。

这个排序说明了什么?说明这三种输入条件确实制造出了三种不同程度的"模态失衡"状态,而且这种差异是可以被量化观测到的,不是研究者的臆想。

接下来更有意思的部分来了。研究者进一步观察,当正向教师和负向教师对同一个学生生成的答案打分时,两者打分差距越大,会发生什么。

这个打分差距,被称为模态平衡对数几率间隔。

模态平衡对数几率间隔:正向教师和负向教师对同一个词元(token)打的对数概率之差,差值越大说明两个教师对这个词元的判断分歧越大。

数据显示,当这个间隔从"低"区间走到"高"区间时,两个教师的注意力比率差距(记作Δρ)从0.031一路涨到0.082,与此同时,学生答案的正确率也从90.7%涨到了100%。

这意味着什么?意味着两个教师对模态平衡的感知差异越大的地方,恰恰是学生答得越准的地方。换句话说,模态平衡这件事本身,居然可以当作一种信号,去预判、去指导训练。这就是整篇论文最核心的洞察:模态平衡不是一个只能事后观察的现象,它可以被转化成训练时可用的特权信息。

OPD-V:把"看没看图"变成训练信号

有了前面的发现,研究者们顺理成章地设计出了OPD-V这套方法。

整个流程可以拆成三步。第一步,学生模型看着原始图片,自己生成一段回答。第二步,正向教师(看放大图)和负向教师(看遮挡图)分别对学生生成的每一个词元打分,注意,是同一批词元,只是打分的"眼光"不同。第三步,比较两个教师的打分差异,也就是前面说的模态平衡对数几率间隔,只有当正向教师的打分明显高于负向教师时,这个词元才会被选中,进入所谓的"信任区域"。

模态平衡信任区域:由那些正向教师打分显著高于负向教师的词元组成的集合,只有落在这个区域内的词元,才会被用来做自蒸馏训练。

在这个信任区域之内,OPD-V才真正执行蒸馏操作,用正向教师的概率分布去指导学生模型调整自己的输出分布,用的是一种叫JS散度的度量方式。

JS散度(Jensen-Shannon Divergence):一种衡量两个概率分布相似程度的数学工具,数值越小说明两个分布越接近,常用在知识蒸馏里让学生分布逼近教师分布。

为什么要这么精挑细选,只在"信任区域"内做蒸馏,而不是对所有词元一视同仁?

原因很直接。如果一个词元连正向教师看了放大图都没觉得比负向教师(看遮挡图)打分高,说明这个词元的生成大概率根本没依赖视觉证据,是靠语言惯性蒙出来的。如果这时候还硬把教师的分布蒸馏给学生,等于是在强化一个本来就没好好看图的坏习惯。

这就像老师批改作文,有的句子明明是抄的模板句,套在哪篇作文里都通顺,这种句子你没法从里面学到"这个学生到底有没有认真观察题目给的材料"。真正值得纠偏、值得学习的,是那些能看出学生"到底有没有认真读材料"的句子,也就是那些材料相关性强的句子。如果不做这个筛选,老师的精力就浪费在了那些和材料无关、光靠套路就能写对的句子上,真正需要纠正的地方反而被稀释了。

值得一提的是,两个教师的分工其实很明确。正向教师提供的是"应该学成什么样"的目标分布,负向教师则不参与提供学习目标,它只负责当裁判,划定"这个词元值不值得学"的范围。论文的消融实验也验证了这一点:只用正向教师,准确率是74.62%;只用负向教师,准确率是71.98%;两者结合,准确率直接冲到80.01%,比单独用任何一个教师都高出至少5个百分点。这说明两个教师确实各司其职,缺一不可。

数据说话:4B模型干翻千亿参数大模型

理论讲完了,重头戏是效果到底怎么样。

研究者在6个基准测试、4种模型底座、5种后训练方法上做了系统对比。基准测试覆盖的场景挺刁钻的,包括V* Bench(在高分辨率复杂场景里找小目标)、ZoomBench(考验能不能从完整图片里揪出细节证据)、HR-Bench(原生4K和8K超高清图片理解)、以及MME-RealWorld(覆盖真实世界场景的中英文测试)。

先看在Qwen3.5-4B这个底座上的对比。原始基础模型的平均分是64.30%。经过标准的SFT(监督微调)之后,涨到66.85%。用GRPO(一种强化学习方法)训练,涨到69.65%。用标准的OPSD自蒸馏,涨到69.26%。用此前提到的Vision-OPD方法,涨到77.10%,已经是相当不错的成绩了。

而用了OPD-V之后呢?

平均分冲到了80.01%,相比基础模型足足提升了15.71个百分点。

这个提升幅度是什么概念?意味着原来10道题大概能答对6.4道,现在能答对8道,多答对了将近1.6道题。而且这个提升是全方位的,在全部六个基准测试上,OPD-V都超过了此前最强的Vision-OPD方法。

更让人意外的是接下来这个对比。这个只有4B参数、用OPD-V训练出来的模型,平均分80.01%,超过了表格里所有列出的闭源模型,包括Gemini-3.1-Pro(79.25%)和Gemini-3.5-Flash(79.24%)。它甚至超过了参数量是自己近百倍的397B版Qwen3.5(77.44%),以及万亿参数级别的Kimi-K2.6(72.81%)。

一个4B的小模型,打赢了1T参数的巨无霸模型将近8个百分点。这在参数规模决定一切的常识里,多少有点反直觉。这也从侧面说明,训练方法的精细程度,有时候比单纯堆参数更能决定模型的实际表现上限。

而且这个效果不是只在Qwen3.5这一个模型家族上灵验。研究者换了另一套架构完全不同的Qwen3-VL系列继续验证。Qwen3-VL和Qwen3.5在处理图文融合的方式上有本质区别,前者用一种叫Interleaved-MRoPE和DeepStack的技术,把视觉特征分层注入到语言模型里;后者走的是早期图文融合路线,还混合用了一种叫Gated DeltaNet的线性注意力结构。

结果是,在Qwen3-VL-4B上,平均分从68.00%涨到74.14%;在Qwen3-VL-8B上,从68.93%涨到73.03%;在Qwen3.5-9B上,从69.75%涨到77.63%。

不管底层架构怎么变,OPD-V的提升效果都稳定存在。这说明这套方法抓住的,是多模态模型一个更本质、更普遍的问题,而不是针对某一种架构打的补丁。

更快、更省钱:效率提升是意外之喜

如果说准确率提升是这篇论文的主菜,那训练效率的提升就是一份意外的甜点。

按理说,OPD-V要多跑一个负向教师的前向计算,看起来应该比标准OPSD更慢才对。但实际测下来恰恰相反。

在Qwen3.5-4B上,每一步训练的耗时从352秒降到240秒,降幅31.8%。在Qwen3.5-9B上,从451秒降到340秒,降幅24.7%。

这是怎么做到的?主要是两个原因。

第一个原因是回答长度的变化。研究者观察训练过程中模型生成回答的长度变化,发现标准OPSD训练到后期,回答会越写越长,最后十步平均长度是553.8个词元。而OPD-V全程保持简短,最后十步平均只有140.9个词元,短了74.5%。

这个现象本身也值得琢磨。为什么标准OPSD训练后期回答会越写越长?一种合理的猜测是,当特权信息(比如标准答案)能被教师直接利用,而学生又没法真正吸收视觉证据时,模型可能会倾向于用更长的文字铺垫去"凑"一个看起来合理的答案,本质上是在用文字堆砌掩盖对视觉信息利用不足的问题。而OPD-V因为筛选出了真正依赖视觉的词元来训练,学生学到的是更直接、更精准的判断方式,不需要绕弯子。

第二个原因是特权信息构造方式的差异。标准OPSD需要把标准答案插入到一个提示模板里,再重建整个多模态的教师输入序列,这个过程本身有开销。而OPD-V只是简单地对图片做放大或遮挡处理,文字部分完全不用变。在9B模型的实测日志里,教师批次构建和预处理这一项,OPSD耗时79.2秒,OPD-V只要15.3秒。哪怕OPD-V要跑两个教师模型,两者加起来的前向计算时间也只要27.1秒,反而比OPSD单个教师的40.4秒还要少。

这个对比挺说明问题的。教师跑几次前向计算不是决定训练成本的唯一因素,构造特权信息的方式、以及模型生成回答的长短,同样重要,有时候甚至更重要。这就好比搬家,你以为请两个搬运工肯定比请一个贵,但如果这两个搬运工搬的都是轻便的小件,而那一个人要搬的是笨重的大家具,最后算总账,两个人可能反而更快搬完,花的钱也更少。

消融实验:哪种"看图方式"组合最有效

论文里还做了一系列细致的消融实验,去验证到底是不是"放大图配遮挡图"这个组合最靠谱,还是随便换个别的操作也行。

固定负向教师用遮挡图不变,把正向教师的放大图换成重复图(也就是把原图原样复制一份),准确率从80.01%掉到75.95%。这说明放大图带来的"突出重点区域"这个效果,是不能被简单的图片重复替代的。

反过来,固定正向教师用放大图不变,把负向教师的遮挡图依次换成模糊处理、剪枝处理(去掉部分区域信息)、以及完全不给图片。结果分别是74.31%、73.74%、72.17%,都比原本的80.01%要差不少。

这几组数字放在一起看,能读出点门道。放大图的关键在于它改变了任务相关区域的"显眼程度",但整体画面构成没变。重复图则完全没有改变任何视觉信息的分布,自然起不到强化视觉线索的作用。而遮挡图的关键在于它是"局部削弱",其余部分的画面上下文还保留着,这种局部性的对比恰恰能让负向教师精准地识别出"这个词元到底有没有真的用到视觉细节"。而完全不给图片,等于直接抹去了所有视觉信息,反而丢失了那种"细微差别"的辨别能力,筛选效果反倒变差了。

这也印证了一个直觉:好的对照组设计,不在于"差异越大越好",而在于"差异要打在关键点上"。就像医生要判断你对某种药物是否过敏,不会直接给你打上致死剂量去测试,而是用微量剂量做皮试,精准地在一个可控范围内制造出可辨识的反应差异。

训练过程中的几个观察

除了最终效果,论文还记录了一些训练过程中的动态细节,挺有意思的。

首先是前面提到的响应长度问题,OPD-V训练全程保持简短稳定,而标准OPSD后期会明显变长。

其次是策略熵的表现。策略熵可以简单理解成模型输出的"多样性"或者"不确定性",如果这个值一直往下掉到接近于零,说明模型陷入了某种固定套路,缺乏灵活性。论文里记录到,OPD-V在4B和9B两个规模的模型上,经过warm-up(热身阶段)之后,策略熵都能稳定维持在一个健康区间,4B是0.827,9B是0.761,没有出现明显的熵坍缩。这说明模型在整个训练过程中始终保持着一种"活跃"的学习状态,没有过早收敛成僵化的答题套路。

再就是模态平衡信任区域本身在训练过程中的稳定性。研究者跟踪了每一步训练里,究竟有多大比例的词元真正落入了这个信任区域。结果是4B模型上平均53.8%,9B模型上平均49.6%,两者都稳定维持在大约一半左右,并且贯穿整个训练过程都没怎么波动。

这个稳定性说明什么?说明这个筛选机制不是训练初期偶然出现、后来就失效的临时现象,而是一直在稳定地发挥作用,持续地把"真正依赖视觉"和"主要靠语言惯性"的词元区分开来。

写在后面

读完这篇论文,最触动我的其实是那张展示注意力比率的图。三个数字,0.148、0.226、0.263,光看数字很平淡,但它证明了一件此前只能靠直觉猜测的事情:模型对图片的关注程度,是可以被精确测量、被排出高低顺序的,而且这个顺序和最终答题的正确率之间存在着可验证的关联。

这让我想起一个更普遍的问题。我们平时评价一个AI模型的时候,往往只盯着它答对没答对,很少去追问它是"怎么"答对的。一个模型可能瞎蒙也能蒙对70%的题,另一个模型可能是真的看懂了图才答对70%的题,从最终得分上看这两者毫无差别,但它们的可靠性和可推广性可能天差地别。OPD-V这篇论文提供的价值,某种程度上不只是提高了几个百分点的准确率,而是提供了一套去度量"模型是不是真的在用它该用的信息"的思路,这个思路应该不只适用于图文模型,任何多源信息输入的AI系统,理论上都可能存在类似的"偷懒依赖某一路信息"的问题。

论文里还有个细节我觉得值得单独说一说:为什么用遮挡而不是模糊来构造负向教师,效果差距会有将近6个百分点。这提醒我,在设计对照实验的时候,"制造差异"这件事本身也有讲究,差异要打在能被清晰辨识的那个点上,而不是笼统地把图片弄得难以辨认。

一个只有4B参数的模型,靠着更聪明地"知道自己该看哪里",打赢了参数量大它两百多倍的对手。这件事留给我们的问题是,如果连"看没看图"这件事都可以被量化、被训练所纠正,那AI系统里还有多少类似的、我们习以为常却从未细究的"隐性偷懒",正等着被人发现?

Q&A

Q1:OPD-V是什么?

A:OPD-V是一种针对多模态大模型的视觉在线自蒸馏训练方法,核心创新是把"模态平衡"(模型是否真正利用了图片信息而非单纯依赖文字)当作训练时的特权信息,通过正向教师(看放大图)和负向教师(看遮挡图)的打分差异,筛选出真正依赖视觉证据的词元来做针对性训练。

Q2:OPD-V相比之前的方法能带来多大提升?

A:在Qwen3.5-4B模型上,OPD-V把平均准确率从基础模型的64.30%提升到80.01%,提升了15.71个百分点,超过此前最强的Vision-OPD方法(77.10%),甚至超过了参数量大上百倍的397B版Qwen3.5和万亿参数级的Kimi-K2.6模型。

Q3:OPD-V训练成本会不会比传统方法更高?

A:不会,反而更低。因为OPD-V训练出的模型回答更简短(比传统OPSD短74.5%),加上教师输入构造方式更高效,实测在4B模型上单步训练耗时降低31.8%,在9B模型上降低24.7%。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-