
这项由浙江大学、同济大学、中国科学院大学和耶鲁大学联合完成的研究,发表于2026年第43届国际机器学习大会(ICML 2026),论文编号为arXiv:2606.05259。有兴趣深入了解的读者可以通过该编号在arXiv平台查询完整论文。
**研究概要:AI看视频,不只是"看",还要"懂"**
如果你曾经用手机拍下一段化学实验过程,然后问AI:"这个实验说明了什么化学原理?"——AI很可能给你一个听起来像模像样、实则驴唇不对马嘴的答案。它"看"到了烧杯、试管、气泡,却不真正理解这背后是什么在发生。这就是今天的视频AI最棘手的困境:感知容易,理解难。
研究团队把这个问题比喻成两种截然不同的学生。第一种学生考试只靠死记硬背,见到熟悉的题目就能作答,遇到需要推理的题目则一筹莫展。第二种学生不仅记住了知识点,还能把知识和眼前的现象结合起来,举一反三,算出答案。当下绝大多数视频AI属于第一种学生——它们的训练素材主要是日常生活的短视频,比如打球、做饭、跑步,缺少真正需要专业知识才能理解的内容。
为了培养第二种学生,研究团队构建了一套名为VideoKR的大规模训练数据集,这是全球第一个专门针对"知识密集型视频推理"任务设计的大规模训练语料库。它包含31.5万条视频推理样本,覆盖14.5万段全新收集的、采用CC开源授权的专业领域视频。研究团队还额外构建了一套全新的评测基准VideoKR-Eval,专门用来测试AI是否真的在"理解"视频,而不是在猜答案。
**一、视频AI的"阅读理解"困境**
考虑这样一个场景:你的高中物理老师在课堂上演示了一个弹簧振动实验,课后要求你分析弹簧的弹性系数。大多数同学能看懂演示过程,但要计算出具体数值,还需要调用课本上学过的胡克定律。这个"看懂现象+运用知识+推导结论"的过程,正是人类理解专业视频的方式。
然而现有的视频AI训练数据,绝大多数来自YouTube上的日常视频——短短几十秒到几分钟的日常场景。这些数据让AI擅长回答"视频里有几个人"、"那个人在做什么运动"这类感知类问题。一旦问题变成"根据视频中试剂的用量,计算生成气体的体积",AI就开始露馅了。
研究团队在正式介绍VideoKR之前,做了一个颇为揭示性的测试:他们拿出目前最知名的三个"知识密集型视频推理"评测基准,分别是VideoMMMU、MMVU和SciVideoBench,用三个顶级AI模型——GPT-5.2、Claude-4.5-Sonnet和Qwen3-VL-235B——做"单帧答题"测试。具体做法是:只给AI看视频中随机抽取的一帧画面,而不是完整视频,然后让它回答问题。
结果令人咋舌:在MMVU基准上,GPT-5.2仅凭一帧画面就能答对将近50%的题目;在VideoMMMU上,三个模型的单帧正确率均超过35%。换句话说,这些号称需要"视频理解"的题目,有相当一部分根本不需要看视频——只要有点常识或者运气就能蒙对。这就好比出了一道数学题,结果大多数学生靠估算就得了高分,根本用不上数学知识。
这个发现促使研究团队下决心做两件事:一是造出真正需要"看视频+动脑子"才能回答的训练数据;二是打造一个不能靠猜的评测基准。
**二、知识银行:先搞清楚"要考什么"**
在开始收集视频之前,研究团队做了一件类似于"编写考试大纲"的事情——构建了一个领域知识银行。
团队手动梳理了全球顶尖大学的本科课程,从中筛选出82个代表性学科,覆盖四大领域:自然科学(包括化学、物理、生物、数学、地质学等20个学科)、工程学(电气工程、机械工程、计算机科学等20个学科)、医疗健康(医学、公共卫生、药学等18个学科)以及人文社会科学(历史、心理学、经济学、法律等24个学科)。
对于每个学科,团队设计了一个四层的知识组织结构,从大到小依次是:学科、课程、讲座、知识点。举个例子,在化学学科下,有"有机化学"这门课程,课程中有"氧化还原反应"这个讲座主题,讲座中又有"氧化还原反应的定义:化学过程中一种物质失去电子……"这样的具体知识点。整个知识银行最终包含63745个知识点,构成了后续视频搜索和题目生成的"考试大纲"。
**三、找对视频:不要课堂录像,要真实场景**
有了知识大纲,下一步是找视频。但这里有个陷阱:如果直接用"牛顿第二定律"作为关键词去搜索YouTube,找到的大多是老师在黑板前讲课的视频。这类视频固然有知识,但太枯燥,而且容易让AI学会"听课"而不是"观察世界"。
研究团队的解决方案颇具创意。他们先让AI根据每个知识点生成1到3个"现实场景描述"。比如,"牛顿第二定律"的场景不是"老师讲解F=ma",而可能是"火箭升空"或者"运动员推铅球"。这些场景再被转换成具体的搜索关键词,帮助找到那些在真实情境中隐含了相关知识的视频,而不是直接解释知识的教学视频。这就像是让学生去生活中找"知识的影子",而不是只在课本里找知识本身。
搜索过程分两轮筛选。第一轮用视频标题和描述文字做初步判断;第二轮则直接看视频画面,确认内容确实与目标知识点相关。此外,所有视频都经过Azure AI的图像内容安全审核,过滤掉不当内容。超过30分钟的视频被排除在外(因为太长的视频理解超出了当前研究范围)。最终,团队收集了146567段CC授权视频。
之所以坚持使用CC(知识共享)授权,是因为现有大多数AI训练数据集对视频版权处理模糊,而VideoKR明确要求每一段视频都有清晰可查的开源授权,确保合法性和可复用性。
**四、题目生成:三个层次,像剥洋葱一样逐步深入**
有了视频,还需要把视频变成训练数据。研究团队设计了一套"技能导向的题目生成框架",把视频理解分成三个递进层次,像剥洋葱一样从外到内。
第一层叫做"基础视频推理"(VIDR),考查的是直接从视频画面就能观察到的内容,比如"温度计读数的总体趋势是什么?"这类问题不需要专业知识,只要认真看视频就能回答,考验的是AI对视觉内容的基本感知和理解能力。
第二层叫做"知识增强视频感知"(KNOWVID),在观察的基础上加入领域知识的识别和应用。比如,"视频中出现的黑色固体起到什么作用?"要回答这个问题,AI不仅要看到黑色固体,还要识别出它是二氧化锰,并且知道二氧化锰在这个反应中是异相催化剂。这就像识别出一个实验仪器叫"分液漏斗",并理解它在化学分离中的功能。
第三层叫做"知识密集型视频推理"(KNOWVIDR),是最难的一层。它要求AI整合视觉信息和领域知识,进行多步骤推理,得出定量结论。比如论文中举的例子:视频展示了一个过氧化氢分解实验,题目要求根据视频中给出的溶液浓度、密度和用量,计算在标准状态下产生的干燥气体体积。这个过程需要先从视频中识别出实验类型,再套用化学方程式,再做定量计算——环环相扣,缺一不可。
**五、人工把关:不能全靠AI自说自话**
生成题目的过程不是让AI自由发挥,而是经过严格的人工介入和多重质量控制。
最开始,34位领域专家(全部具有相关专业的研究生学历)亲手编写了种子样本:每个领域、每个技能层次各150道,共1800道高质量例题。每道题都包含详细的逐步推理过程,清楚说明视觉证据、领域知识和逻辑推理如何共同导向答案。这些种子样本经过双人独立审核,其中74道在第二轮审核时被修改完善。
在大规模生成阶段,AI会模仿种子样本的风格为每段视频生成题目,每段视频对应三个技能层次,每个层次生成两道题,共六道。生成时,AI会看到视频帧(每秒0.2帧,附带时间戳)、三道同类别的人工样本,以及相关知识点。
生成的题目随后经过三道过滤。第一道是自洽性验证:让AI重新用题目和视频推导一遍答案,只有两次推导结果一致的题目才被保留,同时第二次推导产生的推理过程被用作最终的"思维链"标注。第二道是视频依赖性过滤:用两个独立模型(InternVL3.5-38B和Qwen3-VL-32B)在只看文字和随机四帧的条件下答题,如果两个模型都能答对,说明这道题根本不需要看视频,直接剔除。第三道是思维链质量验证:用一个独立的强模型检验推理过程的每一步是否有视频证据支撑,是否能有效区分正确答案和干扰项,不过关的题目被丢弃。
**六、模型选择也要"人工监考"**
在整个数据生成流程中,研究团队使用了七个顶级AI模型组成的"候选池":GPT-5.2、GPT-5-mini、Claude-4.5-Sonnet、Gemini-3-Flash、DeepSeek-V3.2、Qwen3-VL-235B-A22B和GLM-4.6V。之所以不用单一模型,是为了避免某个模型的系统性偏见污染整个数据集——就像只用一个老师出卷,风格会太单一。
但不是每个模型都适合每个流程步骤。团队设计了一套"人工监考"的模型资格认证机制:对于流程中的每个步骤,从每个候选模型那里随机抽取100个实际输出,请领域专家逐一标注错误。只有错误率低于3%的模型,才有资格参与该步骤。在实际运行时,每个具体任务从合格模型池中随机选一个来执行。
结果显示,不同模型在不同步骤上的表现差异颇大。例如,在知识银行构建(把讲座转化为知识点)这一步,GPT-5.2、GPT-5-mini、Claude-4.5-Sonnet、Gemini-3-Flash和DeepSeek-V3.2都合格;但在元数据相关性判断步骤,只有GPT-5.2和Claude-4.5-Sonnet通过;而在视频内容相关性判断(需要看画面)步骤,只有GPT-5.2和Gemini-3-Flash合格;在最核心的题目生成和思维链验证步骤,只有GPT-5.2、Claude-4.5-Sonnet和Gemini-3-Flash被认可。
**七、数据集长什么样:两套"训练包"**
经过上述流程,最终产出31.5万条高质量训练样本,被随机(但保持视频级别的分组)拆分成两个子集。第一套是VideoKR-SFT-201K,共201156条,每条都附带完整的思维链推理过程,供"监督微调"(SFT)阶段使用,就像给学生提供详解答案的习题册。第二套是VideoKR-RL-114K,共114381条,只有题目和最终答案,不含推理过程,供"强化学习"(RL)阶段使用——就像只告诉学生最终结果,让模型自己去摸索推理路径。
两套数据集都包含多选题和开放性问答两种题型。多选题约占一半,另一半是开放性问答。三个技能层次的分布大致是:基础视频推理约占40%,知识增强感知约占33%,知识密集推理约占27%(RL集中后者比例更高,达31%)。视频时长方面,大约57%的视频在25秒到5分钟之间,25%在5到10分钟,17%在10到30分钟,平均时长约344秒——远比现有数据集中常见的几十秒视频更长、更丰富。
研究团队还做了防污染处理:通过YouTube视频ID匹配,直接排除了131段与评测基准重叠的视频;又通过帧级感知哈希和滑动窗口序列匹配,再排除了877段近似重复视频,最大程度避免训练数据泄露到测试集。
**八、VideoKR-Eval:堵住"猜答案"的漏洞**
构建好训练数据之后,研究团队意识到现有评测基准本身就有问题——前面提到,很多题目靠看一帧甚至不看视频就能答对。为此,他们专门构建了VideoKR-Eval这套新评测基准,总共2000道题。
构建过程分两步。第一步是多模型单帧过滤:对VideoMMMU(900题)、MMVU(1000题)和SciVideoBench(1000题)中的每道题,用Qwen3-VL-235B、Claude-4.5-Sonnet和GPT-5.2三个模型各做三轮单帧测试,只有在三个模型全部三轮都答错(即该题确实需要完整视频才能答对)的情况下,才把这道原题保留下来。经过这道严格过滤,1646道题被淘汰,只剩下1254道原题。
第二步是专家重新出题:对于那些被淘汰的视频,不是直接丢掉,而是请领域专家重新围绕这些视频出题,要求新题目必须有清晰的视频画面依据,需要相关领域知识,且有唯一确定的正确答案。这一步贡献了746道新题。最终,1254道原题加上746道专家新题,构成2000道VideoKR-Eval。
相比之下,VideoKR-Eval上的单帧可答率只有大约10%,远低于现有基准的35%-50%,说明这套题目确实更难"蒙"。
**九、训练实验:数据质量才是真正的瓶颈**
研究团队用Qwen2.5-VL-7B和Qwen3-VL-8B两个模型作为基础,验证VideoKR的训练效果。之所以选择这两个模型,是因为它们代表了不同的架构设计和预训练基础,如果两个都能受益,说明VideoKR的价值不依赖于特定模型。
训练流程采用了业界标准的两阶段:先用VideoKR-SFT-201K做一个epoch的监督微调,再用VideoKR-RL-114K做一个epoch的GRPO强化学习(GRPO是一种群体相对策略优化算法,简单说就是让模型同时生成多个答案,根据哪个更接近正确答案来调整策略)。研究团队故意不使用任何花哨的RL奖励工程,目的就是把变量控制住,让数据本身说话。
从主要实验结果来看,效果颇为显著。以Qwen2.5-VL-7B在128帧输入条件下的表现为例:基础模型在知识密集型推理任务上的平均得分是41.9,经过VideoKR完整训练(SFT+RL)后提升到46.6,提升了4.7个百分点。其中MMVU单项从55.7涨到60.5(+4.8),VideoKR-Eval单项从32.7涨到41.2(+8.5)。Qwen3-VL-8B也从48.5提升到51.5(+3.0),在同等规模(7/8B参数量)模型中排名第一,超过了包括Qwen3-VL-8B-Thinking在内的竞争对手。
与此同时,VideoKR训练后的模型在通用视频推理任务(Video-MME、MVBench、LongVideoBench)上的表现基本保持稳定,没有出现"学了新知识忘了旧本领"的问题,这在AI训练中算是一个比较理想的结果。
**十、对比实验:VideoKR为何胜出**
研究团队还把VideoKR与当时市面上可获得的六个主流视频推理训练数据集做了对比,分别是Video-R1-CoT-165k、OneThinker-SFT-340k、VideoRFT-CoT-102K(SFT对比)以及Video-R1-260k、OneThinker-600k、VideoRFT-RL-310K、VideoAuto-R1-83K(RL对比)。每次对比都控制了训练数据量(SFT各取8万条,RL各取5万条),确保对比公平。
在SFT对比中,只有VideoKR训练的模型能超越基础模型的知识密集型推理得分(42.4 vs 基础模型的41.9),而其他所有数据集都让得分下降了,最糟糕的Video-R1-CoT-165k让得分降到了36.2。在RL对比中,VideoKR-RL-114K取得了最高的提升(43.0,比基础模型提升1.1),略高于排名第二的VideoAuto-R1-83K(42.7)。
为什么其他数据集效果有限?研究团队做了一个"难度分析":从每个数据集随机抽取3000道题,用Qwen2.5-VL-7B和Qwen3-VL-8B零样本作答。结果发现,Qwen3-VL-8B在Video-R1、VideoRFT、OneThinker、VideoAuto-R1上的正确率分别是57.1%、51.1%、49.1%、54.5%——也就是说,这些数据集对当前强模型来说已经太简单了,模型不需要努力就能答对,自然学不到多少新东西。而在VideoKR上,同一个模型的正确率只有42.3%,这说明VideoKR对当前最强基础模型来说仍有挑战性,能提供更有效的学习信号。这就像给一个数学竞赛水平的学生做小学数学题,和做高中竞赛题的区别——只有后者才能真正提升他的能力。
**十一、消融实验:拆开来看,每一块都有价值**
研究团队还做了系统的消融实验,逐一验证VideoKR各个设计选择的必要性。
关于三个技能层次的组合效果:当只用基础视频推理(VIDR)数据训练时,知识密集型推理平均得分是41.4;加入知识增强感知(VIDR+KNOWVID)后变化不大,是41.3;但进一步加入知识密集推理层次(VIDR+KNOWVID+KNOWVIDR)后,得分提升到42.4。VideoKR-Eval单项的变化趋势更明显:35.3→35.9→36.8,呈单调递增。这说明三个层次的组合确实是必要的,缺少任何一层都会限制最终效果。
关于思维链的必要性:用同样8万条数据,一组带完整思维链推理过程,另一组只有直接答案。带思维链的组在知识密集型推理上得42.4,不带的只得39.4,差了整整3分。这验证了让模型学习"如何一步步推理",比只让它记住答案更重要。
关于SFT和RL的关系:从实验结果来看,SFT+RL的组合优于单独SFT,而单独RL(直接在基础模型上做强化学习,不经过SFT)也优于单独SFT,说明强化学习能帮助模型发展出更强的泛化推理能力。
关于帧数的影响:研究团队在推理时测试了16、32、64、128帧四种配置,发现输入帧数越多,性能越好,且这种提升在通用视频推理和知识密集推理两类任务上都成立。对于经过VideoKR训练的Qwen2.5-VL-7B,通用推理得分从16帧的60.1%提升到128帧的65.5%,知识密集推理从44.2%提升到46.6%,说明更丰富的视觉信息能帮助模型做出更好的推理,这也间接反映了VideoKR训练让模型更善于利用时序视觉信息。
**十二、AI的"顿悟时刻":案例对比**
论文中展示了几个典型的对比案例,颇能说明VideoKR训练前后的差异。
有一道题展示了一段咖啡品牌的供应链动画视频,问"该公司如何处理相关风险"。OneThinker和Qwen3-VL-8B-Thinking都把答案锁定在"外包"(D选项),理由是视频里出现了卡车和物流环节。而经过VideoKR训练的Qwen3-VL-8B则注意到视频中的咖啡豆图标和从原料到零售的完整链条,识别出这实际上展示的是一家咖啡公司如何通过垂直整合(拥有自己的种植园)来对冲原材料价格波动风险,正确选择了B选项。
另一个案例是关于纳米珠制备实验的题目,问一个"隔夜磁力搅拌步骤"的主要目的。OneThinker认为这只是普通的均质操作(选C),Qwen3-VL-8B-Thinking认为是防止沉淀(选D),而VideoKR训练的模型在推理过程中出现了一个有趣的"顿悟时刻"——它先按常规思路判断是均质或防沉淀,随后注意到视频中的关键信息:之前的超声步骤在氯仿(一种挥发性溶剂)中形成乳液,而后续出现了干燥的固体纳米珠。由此它重新推理:隔夜搅拌的主要作用是更新溶剂-空气界面,驱使溶剂完全挥发,让聚合物和量子点沉淀固化——正确选择了J选项。这种"先有错误直觉,然后通过更仔细的视频观察和知识应用自我纠正"的推理模式,正是研究团队希望看到的。
归根结底,VideoKR的核心贡献不是算法上的突破,而是数据设计上的系统性创新:用精心设计的知识体系引导视频收集,用递进的技能框架组织题目生成,用严格的人工把关保证数据质量,再用多模型交叉验证消除单一模型的偏见。实验结果表明,在不改变训练算法的前提下,仅靠更好的数据,模型在知识密集型视频推理任务上的表现就能超越同规模的所有竞争对手。这对整个AI训练领域来说是一个值得重视的信号:在很多时候,数据的质量和设计方式,可能比算法本身更能决定上限。
如果你对这项研究有兴趣,可以在arXiv平台通过编号2606.05259找到完整论文,VideoKR数据集和VideoKR-Eval评测基准也已在论文对应的项目页面开源,任何研究者都可以免费使用。
---
Q&A
Q1:VideoKR和普通视频AI训练数据集有什么本质区别?
A:普通视频训练数据集主要用日常生活视频(打球、做饭等),只教AI看懂基本动作和场景,缺乏专业知识背景。VideoKR则专门收集了14.5万段专业领域视频,覆盖化学、医学、工程等82个学科,并设计了三个递进难度层次的题目,让AI不只是"看到"视频内容,还能结合领域知识进行多步推理,例如根据实验视频中的用量数据计算反应产物的体积。
Q2:VideoKR-Eval和现有的视频理解评测基准相比有什么改进?
A:现有的知识密集型视频评测基准(如MMVU、VideoMMMU)存在一个明显缺陷——有35%到50%的题目根本不需要看完整视频,AI只看一帧画面甚至靠常识就能答对。VideoKR-Eval通过三个顶级模型的单帧测试过滤掉了这类"假视频题",同时请领域专家为剩余视频重新出题,确保每道题都真正需要完整视频理解和专业知识才能作答,单帧可答率只有约10%,难度明显更高。
Q3:为什么VideoKR训练要同时用SFT和强化学习两个阶段,缺一不可吗?
A:两者有不同的作用。监督微调(SFT)阶段使用带完整推理过程(思维链)的数据,让模型学会"如何一步步分析视频和知识来推导答案",打好基础。强化学习阶段只提供题目和最终答案,让模型在自主推理中不断试错优化,发展出更强的泛化能力。实验显示,SFT+RL的组合效果最好,单独RL也强于单独SFT,省去任何一步都会损失部分性能。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。