
你有没有想过,训练一个视觉语言模型,最贵的不是算力,而是数据本身的质量?
2023年前后,几乎所有做多模态大模型的团队都在疯狂堆数据。LLaVA用了66万条样本,Vision-Flan堆到18万条,InternVL3更是干到2170万条。逻辑很朴素:数据越多,模型越强。可阿里的一个研究团队做了个实验,把LLaVA-1.5-665K数据集砍掉75%,只留25%,结果模型表现反而超过了用全部数据训练的版本。
这不是偶然。他们后来把这个方法用在6百万样本的大规模数据集上,用不到官方InternVL3训练数据量的四分之一,跑出了官方模型94.52%的性能。换句话说,四分之三的数据,可能根本是拖后腿的。
问题来了:怎么知道哪些数据是拖后腿的?
数据体检的盲区
现有的数据筛选方法大概分两类。
第一类看“多样性”,用聚类算法把相似的样本挑出来去重,确保选出来的子集覆盖面广。第二类看“重要性”,通过梯度或者损失函数的变化,判断哪些样本对模型训练贡献大。
这两类方法都有一个共同的盲区:它们都是从数据集整体的角度出发,却没有认认真真看过每一条样本内部“合不合逻辑”。
一条视觉指令数据由三部分组成:一张图片、一个问题(指令)、一个回答。理想情况下,这三者应该紧密咬合:问题必须依赖图片才能回答,回答必须准确对应问题和图片内容。但现实中的数据集里混杂着大量“看起来没问题,其实经不起推敲”的样本。
比如论文里给的例子,一张写着“Lifebuoy”品牌的照片,问题是“Lifebuoy卖什么”,回答是“Lifebuoy卖肥皂”。这个问答对本身没有语法错误,但你把图片换成任何一张写着别的品牌名的照片,这个问答几乎都能原样套用,图片压根没起到关键作用。这种样本就是典型的“视觉依赖度低”,模型学了它,学不到真正的看图能力,反而可能强化“靠语言先验猜答案”的坏习惯。
再比如另一个例子,问题是“这个男人穿什么”,回答却是“这个人在冬天滑雪”。答案压根没回答问题,看似流畅,实际上是自说自话。这种样本教给模型的是一种“答非所问也没关系”的坏示范。
这就好比你雇了一个新员工来审核合同,你以为审核过的合同都靠谱,结果里面混进去一批甲方乙方名字对不上、条款前后矛盾的假合同,审核员却因为格式规范就放行了。表面合格,内核有问题,这才是真正难发现的坑。
如果不做这种内部一致性的检查,模型训练出来会怎样?会更容易产生幻觉,也就是一本正经地编造图片里根本不存在的内容,或者答案和问题脱节,让人觉得“这模型答得挺流畅,但压根没看懂问题”。
数据内在一致性:给每条样本打分的两把尺子
阿里的这个团队提出了一个叫DIC的评分体系。
DIC(Data Intrinsic Consistency,数据内在一致性):一种给单条训练样本打分的方法,衡量图片、问题、答案三者之间是否真的互相支撑,而不是表面凑在一起。
DIC由两个子模块组成,一个叫VIC,一个叫RIC。
先说VIC。
VIC(Visual Information Consistency,视觉信息一致性):衡量图片对生成答案到底提供了多少实质性帮助,如果去掉图片答案照样能猜出来,说明这张图片是摆设。
具体怎么算这个分数?研究者用了一个挺巧妙的“对比实验”思路:让模型在“看得到图片”和“看不到图片”两种情况下分别去预测答案,然后比较两种情况下模型预测的准确程度(用损失函数衡量)差了多少。如果看图之后预测明显更准,说明这张图信息量很大;如果看不看图差别不大,说明这张图基本是摆设。
这个思路来自一个很老但很扎实的信息论概念,叫“信息增益”。你把图片盖住,模型还能猜对答案的概率有多大,如果很大,说明图片没提供额外信息。
打个比方,你去参加一场考试,如果不看题目里附的图表,光凭文字描述就能选出正确答案,那这道题里的图表就是纯粹的装饰,出题人根本没必要放它。但如果那张图表里藏着一个关键数据,不看图你压根答不对,这张图才算真正“有用”。VIC干的就是这件事:把每道题的图表偷偷拿掉,看看学生的答题正确率掉了多少,掉得多,说明图表重要;掉得少,说明图表可有可无。如果不做这个检验,你留下的训练数据里可能大量都是“配了张图但其实图没用”的题,模型学多了,会养成一种“不用看图也能蒙对”的坏习惯,这在实际使用时是致命的,因为真实场景里图片往往才是问题的关键。
计算这个损失差的时候,研究者还加了一个细节处理,叫“词性加权”。
词性加权策略:给句子里的名词、动词、形容词这类“扛内容”的词打满分权重,给“的”“在”“和”这类功能性虚词打低权重,避免这些高频但没实际信息量的词干扰整体判断。
这个处理其实很朴素。你评价一篇作文写得好不好,肯定不会去数它用了多少个“的”字,你看的是它用了哪些实词,表达了什么具体内容。DIC的计算也是同理,如果不做这层过滤,模型可能会因为答案里恰好多用了几个虚词而拿到虚高的分数,这跟内容质量毫无关系。
再说RIC。
RIC(Response Information Consistency,回应信息一致性):衡量答案是不是真的针对问题量身定做的,而不是一段放在哪儿都能凑合用的万能回答。
这个指标的设计思路挺反直觉的,研究者没有直接去评判“答案对不对”,而是反过来做了一个“逆向推理”测试:给模型看图片和答案,让它反推原来的问题是什么,如果反推得很准,说明这个答案信息量足够、和问题贴合得紧;如果反推不出来,说明这答案是一句放在哪里都通用的废话。
这就像你收到一份客服的回复邮件,如果只看这封回复,你能大致猜出客户原来问的是什么问题,说明这封回复是有针对性的;但如果这封回复写得四平八稳、放在任何一次咨询下面都通用(比如“感谢您的咨询,我们会尽快处理”),你压根猜不出客户原来问了什么,这种回复就是典型的“信息量为零”。如果不做这层反推检验,很多敷衍的、模板化的答案会被误判成“合格答案”,因为它们语法通顺、态度友好,唯独没有真正解决问题。
有了VIC和RIC两个分数,怎么合并成一个最终的DIC分数?研究者没有简单相加或相乘,而是取两者中的最小值。
DIC最终分数 = min(VIC, RIC)
为什么取最小值而不是平均或相加?因为团队在实验里发现,如果用加和或者乘积的方式融合,一个指标特别高就能把另一个特别低的指标“拉”上去,结果反而混进了很多偏科的坏样本。用最小值当门槛,等于要求一条样本必须两项都过关才能拿高分,这是一种“一票否决”式的严格筛选。实验数据也证明了这一点:单用VIC筛选,相对性能是101.02%;单用RIC筛选,是97.60%;简单求和是98.61%,简单相乘是98.84%,全都不如最终采用最小值方案的101.40%。
自适应采样:数据配比多少,策略就跟着变
光有打分还不够,你总不能只挑分数最高的那几条,剩下全扔掉,那样选出来的数据可能高度雷同,模型学了半天都是一个套路,缺乏泛化能力。
于是团队设计了一个叫DICS的采样框架。
DICS(Data Intrinsic Consistency Selection,数据内在一致性选择):一套根据目标采样比例动态调整策略的数据筛选算法,既要保证质量又要保证多样性。
这套策略的核心逻辑,是根据你打算保留多少比例的数据(论文里叫采样比例p)来调整筛选的松紧度。
如果你只打算留下比较少的数据(p小于50%),策略是先划出一个候选池,这个候选池的大小是最终目标数量的两倍,池子里全是DIC分数排名靠前的样本。接着在这个候选池里用一种叫“最远点采样”的算法挑出最终要的那部分,确保挑出来的样本彼此之间差异尽量大。
最远点采样(FPS,Farthest Point Sampling):一种贪心算法,每次都挑一个离已选样本集合最远(也就是最不相似)的新样本加入,从而让最终选出的集合尽量覆盖整个数据分布的各个角落。
如果你打算留下比较多的数据(p大于50%),逻辑反过来:先把排名垫底的低分样本直接踢出去,形成一个“核心保留集”,然后再从剩下的样本里,用最远点采样去补足名额,尽量把那些虽然分数不是顶尖但代表性强的样本捞回来。
这个逻辑其实很像开一家精品店和开一家大型超市的区别。精品店货架有限,你只进最好的、最有代表性的那几款,这时候你会严格筛选,宁缺毋滥,对应低采样比例的策略。大型超市货架多,你不能只进十款热销品,那样品类太单一顾客会觉得选择太少,你得进几百个品类,但你至少要把明显过期、质量有问题的商品先剔除出去,对应高采样比例的策略。如果反过来做,精品店进货不筛选,货架上全是滞销货;超市进货光看热销不看品类覆盖,顾客买不到日常需要的东西。DICS就是把这套“开店逻辑”用数学方式在两端之间自适应切换。
论文里还专门做了对比实验,测试了三种不同的采样方式:直接按分数排序取前K个(Top-K)、层次聚类、还有最远点采样。结果显示最远点采样在25%采样比例下拿到了101.40%的相对性能,略高于层次聚类的101.39%,明显优于直接取Top-K的100.40%。这说明单纯按分数排序会丢失多样性,而加入空间覆盖的考量确实有帮助。
实验结果:四分之一的数据,跑赢全量
理论说得再漂亮,最终还是要看跑分。
研究团队在LLaVA-1.5-665K数据集上做了系统对比,用的是LLaVA-1.5-7B模型作为训练底座,评测覆盖12个基准测试,横跨通用能力、知识推理、文档理解、幻觉抑制和开放式对话五大维度。
方法数据规模相对性能
全量数据66.5万100.00%
随机采样16.6万96.69%
基于长度筛选16.6万88.79%
CLIP-Score筛选16.6万98.66%
基于困惑度筛选16.6万89.85%
IFD方法16.6万87.58%
ARDS方法16.6万96.46%
COINCIDE方法16.6万96.88%
DataTailor方法16.6万97.17%
PRISM方法16.6万97.66%
DICS(本文方法)16.6万101.40%
只用四分之一的数据,DICS就跑赢了用全部数据训练的基线模型1.4个百分点。这不是靠某一个单项指标撞大运撞出来的,DICS在MMBench中文版、MMMU、DocVQA、InfoVQA、POPE等多个基准上都拿到了当时对比方法里的最好成绩。
对比之下,有些筛选方法看起来能在个别指标上冲高,实际是牺牲了全局能力换来的。比如按文本长度做筛选的方法,在HallusionBench(幻觉检测)上得分很高,因为它倾向于选短答案,短答案确实更不容易产生幻觉,但代价是整体性能只有全量数据的88.79%,足足少了11个百分点,模型的推理深度和信息密度被砍没了。
再看采样比例变化的曲线。当采样比例低于25%时,DICS的领先优势最明显,说明高质量样本筛选在数据稀缺场景下价值最大。当采样比例来到50%左右,DICS的性能达到峰值,103.15%。继续往上加数据,性能开始缓慢回落,因为高比例意味着低质量的样本也开始被迫混进来。有意思的是,即便性能开始回落,DICS依然一直压制着其他对比方法,说明它筛选噪音的能力更强,把低质量数据留到了更晚才不得不引入。
团队还专门测试了DICS在完全不同数据分布下的表现,用的是Vision-Flan-186K数据集,这个数据集的任务类型和LLaVA的对话式数据差异很大,涵盖191种细分视觉语言任务。结果DICS依然拿到了99.91%的相对性能,几乎追平全量数据训练的效果,证明这套方法不是只在特定数据集里凑巧管用。
跨架构的迁移能力:小模型选的数据,大模型用得上
另一个让人意外的发现,是DICS的评分标准不依赖于具体的模型架构。
研究团队用LLaVA-1.5-7B模型计算DIC分数选出的数据子集,拿去训练Qwen2-VL-7B,结果性能达到全量数据的101.25%,反过来用Qwen2-VL-7B选出的数据训练LLaVA,同样也有提升。这说明DIC评分抓住的是数据本身内在的、跨模型通用的质量属性,而不是某个特定模型的“个人偏好”。
更值得关注的是一个“小模型筛选,大模型受益”的实验:用7B规模的LLaVA模型去打分和筛选数据,然后拿这批数据去训练13B规模的更大模型,结果相对性能达到101.79%,是所有测试组合里提升幅度最大的一组。
这个结果的实际意义在于,你不需要用最贵、最大的模型去做数据筛选这一步,用一个轻量级的模型打分,选出来的数据依然能喂饱一个更大的模型。这就好比一个经验丰富但薪资不高的初级审稿人,帮你把明显不合格的论文投稿筛掉,你之后请顶级专家来做终审,专家看到的都是已经经过初筛的稿子,效率会大大提升,而且顶级专家也不需要浪费时间在那些一眼就能看出问题的稿件上。如果不这样分层筛选,直接让顶级专家审阅所有原始投稿,成本会高到离谱。
规模验证:600万样本,用不到四分之一打平官方模型
前面的实验都还是在几十万级别的数据集上做的,团队想知道这套方法在百万级数据下是否依然站得住脚。
他们按照InternVL3官方公开的数据收集协议,自己攒了一个600万样本的语料库,叫DICS-6M,涵盖图像描述、通用问答、数学推理、图表理解、OCR文字识别、文档理解、GUI界面操作、代码等12大类任务,任务分布相当均衡,不是靠单一来源撑量。
在InternVL3-8B模型上做全量微调作为基线,DICS选取不同比例的数据分别训练:
采样比例数据规模相对性能
15%90万99.26%
25%150万101.47%
50%300万100.32%
75%450万101.86%
85%510万103.10%
85%采样比例时表现最好,比全量数据高出3.10个百分点。团队还拿这个结果去对比官方发布的InternVL3-8B-Instruct模型,官方版本用了2170万训练样本,DICS用了510万,不到官方的四分之一,跑出了官方模型94.52%的性能水平。
这个对比其实说明了两件事。一是DICS-6M这个语料库本身质量确实不错,二是原始的视觉指令数据里存在大量冗余,很大一部分数据对模型训练的边际贡献极低,甚至可能是负贡献。
消融实验:拆开看看每个部件到底有没有用
任何一个方法说自己好用,都得经得住拆解检验。研究团队做了细致的消融实验。
如果只用最远点采样保证多样性,完全不管DIC分数(也就是纯多样性采样),相对性能只有97.02%,比全量数据训练还差,这直接证明了“光讲多样性不讲质量”是行不通的。
单独用VIC筛选,相对性能101.02%,对通用能力提升明显;单独用RIC筛选,97.60%,但在幻觉类指标上表现突出。这说明VIC负责保证视觉信息真的被用上了,RIC负责保证回答逻辑上说得通,两者分工不同,缺一不可。
去掉之前提到的“词性加权”策略,性能从101.40%掉到100.25%,证明关注实词、忽略虚词这个细节处理确实有实际效果,别看这只是个小小的权重调整,累积起来对最终结果有实打实的影响。
注意力可视化:模型真的“看”得更准了
除了跑分数字,研究团队还做了一个挺直观的可视化实验,观察模型回答问题时到底在图片的哪个区域投入了注意力。
拿一张马的照片举例,问题是“图片里的马是什么颜色”,答案应该是“棕色”。用DICS筛选的数据训练出来的模型,注意力高度集中在马的身体轮廓上,精准锁定了问题的核心对象。而用随机采样、或者其他对比方法(DataTailor、PRISM)训练出来的模型,注意力分布得比较散,有些甚至跑到了背景的雪地或者其他不相关区域。
这个可视化结果和前面的跑分结果是相互印证的:DICS选出的数据教会了模型“该往哪里看”,而不是靠蒙对答案。这就像同样是学开车,一个学员每次遇到红绿灯都真的抬头去看灯的颜色,另一个学员靠着路口车流的经验大致猜测该不该停,后者也许大部分时候能蒙对,但遇到极端情况(比如灯坏了、或者场景稍微变化),前者才是真正靠得住的。
团队还专门做了两个额外的验证实验,来证明DIC分数不是自娱自乐的数字游戏。第一个是“人为破坏测试”:随机抽取1000条样本,故意往里面注入三种“毒药”,把图片换成不相关的、往答案里塞事实错误、把答案换成千篇一律的模板回复,结果三种破坏方式都让对应的DIC分数明显下降,其中图文不匹配这种破坏方式,让VIC分数下降了43%,说明这套指标确实对数据质量的劣化很敏感。
第二个是找真人和另一个大模型分别对样本打分,看看这个打分和DIC分数是不是有相关性。结果显示DIC分数越高的样本组,无论是人类评委还是AI评委给出的质量分都在稳步上升,统计学上的相关系数达到了显著水平。这基本证明了DIC不是自说自话的一套指标,它确实和真实的“质量感受”对得上。
计算成本:省下来的时间去哪儿了
一个筛选方法如果本身耗时耗力,那省下的训练时间可能又被筛选步骤吃掉了。团队专门算了一笔账。
在LLaVA-665K这个规模上,用8块A100显卡跑数据筛选大概需要12小时,选出25%子集之后训练时间是14小时,总共比直接用全量数据训练(15小时)还省了1小时。在600万样本的DICS-6M实验里,用32块A100,筛选加训练总共85小时,比全量训练基线省了5小时,同时还带来了3.10%的性能提升。
之所以能做到又快又准,是因为DICS的打分过程只需要模型做“推理”,不需要反向传播更新参数,计算量天然就比训练轻。而且这个打分过程是逐条样本独立完成的,天然适合并行处理,数据规模越大,这种并行优势就越明显。
写在后面
读完这篇论文,最让我意外的一点,是那个“小模型筛选数据、大模型训练受益”的实验结果。这打破了一个我一直下意识相信的假设:以为数据筛选这种精细活儿,必须用最强的模型才靠得住,否则挑出来的东西质量堪忧。但DIC分数的跨架构迁移能力说明,数据本身的内在一致性,其实是一个相对独立于具体模型能力的属性,一张图文根本不搭的数据,不管是7B模型还是70B模型来判断,结论大概率是一致的。这背后的逻辑其实挺朴素:判断一份合同条款是否自相矛盾,不需要请最贵的律师,一个认真负责的初级审核员往往就够了。
另一个值得单独拎出来说的细节,是团队在计算RIC时采用的“逆向推理”思路,不问答案对不对,而是反过来看答案能不能帮你猜出问题是什么。这种反向验证的思路在其他领域也挺常见,比如密码学里有种叫“零知识证明”的思路,核心也是通过间接的方式验证信息,而不是直接摊开来对比。RIC的设计某种程度上是把这种“间接验证”的思维用到了数据质量评估上,挺巧妙的一个迁移。
论文里也留了一些没解决的问题,比如现在这套方法只针对图文数据,视频和音频这种更复杂的模态还没覆盖。另外团队提到未来可能会考虑“修复”低质量样本而不是简单丢弃,这个方向如果真做起来,可能比单纯筛选更有意思,毕竟丢弃是做减法,修复才是真正把烂数据变成好数据,是做加法。
那些被DICS筛掉的四分之三数据,究竟是当初标注时的疏忽,还是任务本身天然就充满了这种"看图说话"式的语言先验陷阱?这个问题,或许比筛选方法本身更值得琢磨。
Q&A
Q1:DICS是什么?
A:DICS是阿里团队提出的一种视觉指令数据筛选方法,核心是通过评估图片、问题、答案三者之间的内在一致性打分,再结合多样性采样,挑选出高质量的训练子集,用更少的数据训练出更强的视觉语言模型。
Q2:DICS筛选数据的效果如何,真的能超过全量数据训练吗?
A:在LLaVA-1.5-665K数据集上,DICS用25%的数据训练出的模型,性能达到全量数据训练的101.40%。在600万样本的大规模验证里,用不到官方InternVL3训练数据量四分之一的数据,跑出了官方模型94.52%的性能。
Q3:DIC评分是怎么计算的,主要看哪两个指标?
A:DIC由VIC和RIC两个模块组成,VIC衡量图片对生成答案的实质性贡献程度,RIC通过让模型反推问题来衡量答案和问题的匹配程度,最终DIC分数取两者中的较小值,确保样本在两个维度都合格。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
DreamX团队发布70亿参数的DreamX-Creator 1.0,首次以小体量实现原生音视频联合生成,配备门控跨模态注意力、强化学习后训练与2K一步刷新模块,权重开放,性能媲美更大规模开源系统。