
你有没有想过一个问题:如果一个学生每次考试都拿90分,你会说他很聪明吗?
大概率会。但如果这个学生做的题目永远只是"看一段视频,回答一个问题",答案就写在视频画面里,从头到尾不需要离开考场半步,你可能就要打个问号了。这更像是背题库,而不是真本事。
这正是当下视频理解AI面临的尴尬处境。像Video-MME这样的主流测试基准,顶尖模型的准确率已经逼近90%。这本该是一件值得庆祝的事,但换个角度看,它可能只是说明了一件更朴素的事实:这些题目,已经不够难了。
一群来自香港中文大学、蚂蚁集团、清华大学、同济大学和香港科技大学的研究者们,决定把考题难度拉高一个层级。他们做的这套新测试题,叫VideoGAIA,全名是"面向通用人工智能助手的智能体视频理解基准"。它想问的问题很直接:如果不让AI只看一段视频就答题,而是让它像人一样,边看边查资料、边搜索边推理,它还能拿高分吗?
答案是:不能。所有测试过的模型,包括最顶级的GPT-5.5和Kimi-K3,正确率全都低于60%。
视频理解的"应试教育"困境
先说说传统视频理解测试到底是怎么考的。
**智能体**:能够自主感知环境、做出决策并采取行动的AI系统,区别于只能被动回答问题的传统对话模型。
拿Video-MME打比方,一道典型题目长这样:给你一段圣诞节居家场景的视频,问"视频结尾壁炉上方挂了几只红袜子",选项是1只、2只、3只还是4只。答案就在视频画面里,你只需要认真看,数清楚,选对选项就行。
这类题目考验的其实是模型的**感知能力**:能不能看清画面细节、记住时间顺序、识别物体数量。这确实很重要,是所有视频理解的地基。但问题是,随着模型越做越大、训练数据越来越多,这类"看图数数"式的题目正在被迅速攻克。
如果你把这个场景换成开卷考试会怎样?答案就写在书本第几页第几行,学生只需要会翻书就能得满分。这时候考试还能区分出谁真的聪明、谁只是记性好吗?很难。视频理解基准现在面临的正是这种情况:答案就摆在那儿,模型只需要"看清楚"就赢了,至于它会不会主动查资料、会不会判断信息够不够用、会不会在多个线索之间做交叉验证,这些统统没有被考到。
而这些恰恰是通用AI助手最需要的能力。
研究团队提出了一个尖锐的观察:现在的基础模型正在从"聊天机器人"转向"生产力工具",这个转型需要的核心能力,比如工具调用、长链条推理、信息整合、上下文管理,都还远未成熟。但现有的视频理解测试完全没有覆盖这些维度,它测的还是2020年那种"看视频回答问题"的老套路。
VideoGAIA到底考什么
VideoGAIA设计了一道更像现实生活的题目。
来看论文里给出的例子。视频里,一个主持人在灯光绚丽的直播间展示了很多手机,他举起一部背面透明的银色手机,旁边摆着绿色的产品台。问题是:根据厂商的官方宣传,这款手机具体搭载的是哪个芯片型号?
**图片里看不到这个答案**。视频只是给出了线索:手机的外观、颜色、直播间的场景。要回答"具体芯片型号",模型必须先从画面中识别出这是哪款手机,再主动去搜索这款手机的官方参数页面,把网页内容读出来,最后综合视频线索和网络信息给出答案。
这就是VideoGAIA和Video-MME最根本的区别。前者要求的是闭卷考试式的单轮问答,答案就在视频里,证据自成体系;后者要求的是开卷调查式的多轮对话,视频只是破案的第一条线索,真正的答案得靠模型自己去外部世界找。
**多轮交互**:模型需要经过多次"思考-行动-观察"的循环才能完成任务,而不是一次性给出答案。
打个不那么恰当但很贴切的比方,如果Video-MME是让你看一段监控录像回答"画面里有几个人",那VideoGAIA就是让你看一段模糊的监控录像,问你"画面里这个戴帽子的人,他的车牌号对应的车主是谁"。前者只需要认真看,后者需要你先从画面中抓住可辨识的线索(比如车型、颜色、周边环境),再去车管所、社交媒体或者其他渠道核实信息,最后拼凑出完整答案。如果不做后面这一步调查,你手里的信息永远是不完整的。
271道题是怎么造出来的
VideoGAIA最终只保留了271道题,但这个数字背后是一个相当严苛的筛选流程,起点是10万段互联网公开视频。
整个流程可以分成四个阶段:数据收集与视觉描述、任务生成、模型过滤、人工标注。
第一步是给视频"写详细笔记"。研究者以每秒1帧的速度采样视频,最多保留每段24帧,用Gemini-3.1-Pro给每一帧生成详细的视觉描述,并通过OCR技术提取画面中出现的文字信息。
**OCR**:光学字符识别技术,能够从图像中自动提取和识别文字内容。
接下来是"埋线索"的环节,用Claude-Opus-4.7从视觉描述和文字记录中提取2到5个可复用的视频锚点。这些锚点可以是一个物体、一段文字、一个标志、一个地点、一个人物、一个动作,或者某种空间关系。
**视频锚点**:视频中具有辨识度、可用于构建问题线索的关键视觉元素,比如一个特定的标志或者一个独特的动作瞬间。
有了锚点之后,GPT-5.5负责找出适合出题的目标属性,并给出候选答案。这个阶段有一条硬性规定:如果没有靠谱的候选事实,这段视频直接被淘汰。而且题目必须依赖多个视频锚点,不能只靠一帧画面就能答对,否则又会退化成"看图说话"。
为了确保外部证据链条真实存在,研究团队用视频锚点描述加上目标属性组成搜索关键词,通过Serper API做搜索,再用Jina API把搜到的网页转换成文本内容。这一步的意义在于,出题人自己要先走一遍"破案"流程,确保这道题真的能通过外部搜索找到答案,而不是凭空编造。
生成的候选题目还要经过极其严格的质量把关。首先是硬性约束检查:题目必须包含至少两个需要网络搜索或网页提取才能完成的推理环节,答案必须能在检索到的网页标题、摘要或原文段落中找到明确支撑,还要求涉及至少两个视频锚点、多帧观察、用视觉描述隐藏答案实体,并且构建从视频证据到网络信息的多跳推理链。
通过硬性约束的题目,接下来会被Claude-Opus-4.8按照六个维度打分,包括是否严格需要多个锚点、是否包含至少三步不同推理、是否至少两步需要联网操作、问题是否用视觉描述而非直接暴露答案、答案是否唯一对应一个标准事实、问题表述是否简洁准确。每项打1分或2分,满分12分,只有得分8分以上的题目才能继续留在候选池里。
之后是**跨模态过滤**,检查一道题是否真的需要视频和文本两种信息共同作用才能解答。
**跨模态过滤**:分别测试模型能否仅凭视频画面或仅凭网页文字单独解出答案,如果任何一种单一信息来源就能作答,说明这道题不够"多模态",会被剔除。
具体做法是,让Gemini-3.1-Pro只看视频作答,让GPT-5.5只看网页内容作答,同时对每个视频锚点做消融测试,逐一移除后看题目是否还能被解答。只要有一种单模态方式能蒙对,这题就被淘汰。
紧接着是**工具必要性评估**,把所有外部工具关掉,让Gemini-3.1-Pro、GPT-5.5、Claude-Opus-4.7仅凭视频和自身知识储备直接作答。只要有任何一个模型答对了,这道题也会被踢出局,因为这说明它其实是道传统的单轮视频问答题,根本不需要智能体式的多轮工具调用。
最后一道关卡是安全筛查,剔除包含个人隐私信息(比如身份证号、信用卡信息)和成人、暴力内容的视频。
经过这五轮筛选,10万段种子视频只剩下847道候选题目。而这还没完。因为模型的判断并不总是可靠的,最后一步是人工众包标注,每道候选题由三位人类专家独立核实,亲自看视频、做搜索、判断答案是否唯一且正确。三人全部通过的题目直接保留,两人通过的进入加审环节,只有一人或零人通过的直接淘汰。
这套流程动用了15名标注员、超过100个小时的人工投入,最终从847道候选题里筛出271道,构成了VideoGAIA的正式题库。这个层层过滤的过程其实很像招聘时的多轮面试,每一轮都会刷掉一批人,最后进入终面的候选人数量已经很少了,但留下的都是真正扛得住考验的。如果只做一轮简历筛选就录用,你招进来的人很可能名不副实,这和让AI只答一次题就打分是同一个道理。
271道题里都是什么内容
最终的题库覆盖六大类现实场景:地理(63题)、日常生活(61题)、文化(58题)、历史(44题)、科技(39题)、经济(6题)。这六大类下面又细分出39个具体子领域,涵盖体育娱乐、动植物、影视音乐、传统工艺、政治机构、消费产品等各个角落,几乎覆盖了普通人生活会接触到的方方面面。
难度上分成两级。L1是62题,相对简单;**L2是209题,占了整个题库的77.12%**,代表更复杂的多步骤证据收集和跨模态推理任务。
视频长度平均34.9秒,最短的只有2.74秒,最长的能到566.68秒,也就是九分半钟。这个跨度设计得很有心思,既有转瞬即逝的短片段考验模型的即时抓取能力,也有长视频考验模型在时间线上定位关键片段的能力。
问题的英文平均长度是45.06个词,而答案平均只有3.73个词。这个数字反差本身就说明了VideoGAIA的出题逻辑:问题必须包含足够多的视觉指代和线索信息才能锁定唯一答案,但答案本身是一个简洁、明确的事实,不是开放式的长篇论述。这种设计避免了"多选题蒙对"的可能性,因为整个测试都是开放式问答,没有选项可以猜。
20个顶尖模型,没有一个及格
数据造好了,接下来就是真刀真枪地考试。
研究团队一共测试了20个当下最前沿的多模态大模型,包括Qwen系列、GLM系列、Kimi系列、Gemini系列、Claude系列以及GPT系列的多个版本。所有模型都在同一套统一的测试环境下比拼,公平起见没有任何模型享受特殊待遇。
**ReAct智能体循环**:一种让AI模型交替进行"推理"和"行动"的工作模式,模型每一步都要先思考接下来该做什么,再执行一个具体动作,然后根据结果继续下一轮思考,如此循环直到给出最终答案。
具体的测试设置是这样的:每个模型拿到问题,同时收到从整段视频中均匀采样的20帧粗略画面。模型可以交替使用三种工具,网络搜索用来查资料,网页访问用来把搜到的网页转成可读文本,视频细看则允许模型从自己指定的某个时间段里再抽取最多20帧做仔细观察。整个交互过程最多允许40步,所有模型的提示词、工具设定、帧分辨率、步数上限完全一致。
结果如何?没有一个模型突破60%的准确率。
排名第一的是字节跳动的Seed2.0-Pro,58.30%。第二名是阿里的Qwen3.7-Plus,56.09%。第三名是Kimi-K3,54.61%。GPT-5.5排在第四,53.14%。
这个数字放在Video-MME那种接近90%的成绩单旁边,落差相当刺眼。同样是"视频理解"这四个字,换了个考法,最强模型的成绩直接腰斩还多。
更有意思的是,模型的迭代升级并不总是带来进步。Kimi系列、GLM系列、Gemini系列都表现出稳定的代际提升,比如Kimi从K2.5的49.82%涨到K2.6的52.77%,再涨到K3的54.61%,一路向上。但Claude系列却出现了反常现象:Claude-Opus-4.7只有34.69%,Claude-Opus-4.8也只有36.90%,两者都远低于更早的Claude-Opus-4.6的47.97%。
这说明了什么?说明模型整体能力的提升,并不会自动转化成可靠的多模态工具使用能力。就像一个学生英语单科成绩突飞猛进,但你不能因此断定他数学也会同步进步,因为这是两种完全不同的能力体系,训练一个不代表另一个自动跟上。
难度分级揭示的真相
VideoGAIA把题目分成了L1和L2两个难度级别,这个分级不是随便拍脑袋定的,而是切切实实地反映了任务复杂度的差异。
对比三个头部模型在两个难度级别上的表现会发现一个惊人的一致性:Seed2.0-Pro从L1的75.81%掉到L2的53.11%,Qwen3.7-Plus从79.03%掉到49.28%,Kimi-K3从77.42%掉到47.85%。三个模型的降幅都在22到30个百分点之间。
这组数字告诉我们,L2难度不是简单地换了几个题目类别,而是真正提高了任务的复杂程度。研究者观察到,L2的题目往往需要模型解析更隐晦的视觉指代信息,发起多次有针对性的搜索,还要在视频观察结果和网页信息之间做交叉核实。
工具用得多,不代表答得对
研究团队还专门统计了五个代表性模型在271道题目里到底调用了多少次工具,以及这些工具用在了哪。
结果很有意思:网络搜索是所有模型都最依赖的工具,占比在60.5%到90.6%之间,而网页访问的比例始终不超过14%。Kimi-K3在"视频细看"这个工具上的使用比例最高,达到25.5%,说明它更倾向于反复回看视频中的关键片段来验证信息。
但真正值得琢磨的是这组数据:Gemini-3.1-Pro一共发起了2557次工具调用,其中90.6%是搜索,调用量惊人;而GPT-5.5全程只调用了262次工具,调用量远远低于前者。可是GPT-5.5的最终准确率反而更高。
这个现象戳破了一个直觉性的误解:调用工具越多,是不是就意味着模型查得更认真、答得更靠谱?答案是否定的。
想象两个人去图书馆查资料完成一份报告。一个人东翻西找,翻遍了半个书架的书,笔记记了厚厚一沓,但最后交上来的报告漏洞百出;另一个人只找了三本关键的书,直接翻到了最相关的章节,报告写得又准又快。翻书次数从来不是报告质量的保证,找对地方、抓准重点才是。**如果不学会克制、不知道什么时候该停下来,再多的工具调用也只是无效功**。真正厉害的智能体,应该懂得挑选最有信息量的视频片段,去权威可靠的信息源核实,一旦证据足够就果断收手。
到底错在哪儿
除了统计工具用量,研究团队还专门做了一次错误溯源,把五个代表性模型给出的全部615个错误答案,逐条归因到五个可能的失败源头:视频感知、网络检索、证据推理、答案生成、智能体执行。
结果显示,视频感知失误是所有模型最大的错误来源,占比从36.8%到48.0%不等。这说明一旦模型在起点就抓错了关键视觉线索,后面所有基于这个错误锚点展开的搜索都会跟着跑偏,一步错、步步错。
网络检索环节的失误占比在20.3%到31.0%之间,证据推理环节占14.2%到28.6%,这两项分别揭示了两个截然不同的瓶颈:一个是"找不到",一个是"找到了但用不好"。答案生成本身出错的比例很低,只有2.4%到3.3%,说明大多数失败不是因为表达不清或格式不对,而是真正的认知链条断了。
有一个例外值得单独提一句:GPT-5.5的智能体执行环节错误率高达13.4%,远高于其他模型不到5%的水平,主要原因是它生成的行动指令格式不规范,导致系统解析失败。这算是一个纯工程层面的坑,但也提醒我们,一个模型即便逻辑推理能力再强,如果连"按规矩说话"这一步都做不好,照样会白白丢分。
一个具体的破案现场
论文里给出了一个非常生动的案例,展示了正确和错误的智能体是如何走向完全不同结局的。
视频里出现了一辆Honda摩托车,画面能看到本田标志、"日本制造"的字样、一个叫RC Valve的部件,还有红色车身。问题是:这辆车的具体排量是多少?
这些线索看起来已经很详细了,但其实存在歧义,因为本田旗下有两款车型CR125和CR250都使用RC Valve系统,光凭这些视觉证据无法唯一确定答案。
Seed2.0-Pro是这样破案的:第一次搜索发现CR125和CR250都用RC Valve,两个候选都成立;回看视频确认没有清晰可辨的排量铭牌,于是保留两个假设同时推进;第二次搜索寻找一个能区分这两款车型的视觉特征,找到了排气管形状这个线索;再次回看视频,观察到发动机出口处排气管紧接着一个明显的急转弯,这个特征正好对应CR250;最终给出正确答案249cc。
反观Claude-Opus-4.8是这样处理的:让视频工具去读一处疑似排量铭牌的位置,把一片模糊的区域解读成"MAX 125cc",即使它自己的观察记录里都写明了"存在眩光和不确定性",它依然直接采信了这个不可靠的读数,既没有去网上核实,也没有认真评估CR250这个竞争假设,就草率给出了125cc的错误答案。
这个对比案例把VideoGAIA真正想测试的能力说得清清楚楚:它考的不只是"看得清楚",也不只是"查得到资料",而是能不能在信息不确定的时候保持怀疑,知道下一步该去核实什么,并且把查到的外部知识和有针对性的视频复查结合起来交叉验证。这种"带着怀疑往前走"的能力,恰恰是当前大多数模型最欠缺的。
效率也是一门学问
研究团队还做了一个挺实用的分析:花的钱多、生成的内容长,是不是就意味着答得更准?
他们统计了每个模型平均每道题产生的可见输出token数量,以及按照各家公开定价换算出的输出成本(这个成本只算了输出部分,没有包含输入、外部工具调用、裁判模型调用等费用,所以是一个偏保守的估算)。
**Token**:语言模型处理文本的基本单位,可以粗略理解为一个词或者一个词的片段,token数量越多通常意味着生成的内容越长。
结果显示,回答长度和准确率之间只有很弱的负相关,统计上并不显著。而总输出成本和准确率之间的负相关稍微强一点,但也没有达到统计显著的程度。
具体来看,排名第一的Seed2.0-Pro平均每题只用391个token,总成本约0.251美元;排名第二的Qwen3.7-Plus用426个token,成本0.136美元,两个成绩最好的模型反而是"话最少、花钱最少"的那一类。相反,Gemini-3.5-Flash平均每题耗费3701个token,总成本高达9.03美元,Claude-Opus-4.6的总成本更是达到17.37美元,但这两个模型的最终准确率都排在中后段。
这组数据传递的信号很清楚:思考得长不等于思考得对,花钱多也不等于查得准。真正有效的推理,应该是精准地获取有价值的证据、避免无意义的重复搜索、并且在证据足够时果断收尾,而不是靠堆量取胜。
表格里的细节
从各个类别的表现来看,没有任何一个模型能在所有六个领域都称霸。Seed2.0-Pro在地理和科技类目上领先,Kimi-K3在日常生活类目上最强,GPT-5.4则在文化和历史类目表现最好。这种"偏科"现象在雷达图上体现得尤其明显,不同模型的表现轮廓形状差异巨大,说明每个模型都有自己独特的能力短板和长处,没有谁是全能选手。
需要说明的是,经济类目只有6道题,样本量太小,这一类的百分比数字波动性会比较大,参考价值有限。
写在后面
读完这篇论文,最让我意外的一个细节其实是那个成本效率的分析。
我们通常会下意识地认为,模型愿意多花力气、多调几次工具、多写几段推理过程,答案应该会更靠谱。但数据摆在那里,成绩最好的两个模型恰恰是token用得最少、调用工具次数相对克制的那两个。这提醒我一件事:智能体系统的评价标准,不应该只看它"做了多少事",而要看它"做对了多少事"。这个思路其实也适用于人类的工作方式,忙碌本身从来不是产出的保证。
还有一点值得琢磨。论文里提到Claude系列出现了"新版本反而不如老版本"的反常现象,这在论文的众多模型对比里是个孤例,但它戳破了一个我们习以为常的假设,也就是"模型越新,各方面能力都会同步提升"。真实情况可能是,不同能力维度的训练是相对独立的,一个模型总分能力的提升,不必然带来它在某个特定任务上(比如多模态工具使用)的进步,这中间没有必然的因果链条。
这篇论文没有解决的问题也很明显:它目前只覆盖了英语场景,也几乎没有涉及视频里的音频信息。一个真实的视频,声音往往携带着画面之外的大量信息,比如背景音乐、说话者的语气、环境噪音提供的线索,这些在VideoGAIA里都还是空白。如果哪天有人把音频维度也加进来做一套新的测试题,AI的成绩会不会又跌回一个更让人意外的数字?
Q&A
Q1:VideoGAIA是什么?
A:VideoGAIA是由香港中文大学、蚂蚁集团、清华大学等机构联合推出的智能体视频理解基准测试,包含271道人工验证过的任务,要求AI模型不只是看视频回答问题,还要主动调用网络搜索、网页读取、视频回看等工具,通过多轮交互整合视频证据和外部信息才能作答。
Q2:为什么现有的视频理解测试不够用了?
A:像Video-MME这样的传统测试,答案通常直接摆在视频画面里,模型只需要看清楚就能答对,顶尖模型准确率已经逼近90%。但这类测试考不出模型主动查资料、判断信息是否充分、跨来源核实事实的能力,而这些恰恰是通用AI助手最需要的本领。
Q3:VideoGAIA的测试结果说明了什么问题?
A:所有20个顶尖模型准确率全部低于60%,最高的Seed2.0-Pro也只有58.30%。研究还发现,工具调用次数多不代表答案更准,模型迭代升级也不总是带来进步,视频感知错误是所有模型最大的失分来源,说明当前AI在证据获取和验证环节仍有明显短板。
好文章,需要你的鼓励
这篇论文提出一种插件式2D动作接口,让已训练好的3D运动语言模型无需修改或微调即可直接理解2D姿态输入。实验证明2D输入效果媲美3D输入,且在真实视频场景下配合专门的降噪适配器,2D方案比3D姿态估计更省算力、更实用,为动作理解模型的现实部署提供了新路径。
研究团队让8种AI智能体独立完成100项真实科研任务,深度剖析800份研究轨迹后发现,即便是最强模型,也普遍存在"发现问题却不修正"的现象,背后根源指向AI缺乏检验自身产出、主动纠错的元认知能力。
WorldRover是一套面向可探索世界建模的合成视频数据引擎,基于虚幻引擎构建,能让同一段探索轨迹在保持路线与场景一致的前提下,重新渲染为多种视角和外观状态,并同步提供深度、光流、长程点追踪等丰富标注,最终发布WorldRover-10M数据集,含2190万帧、202.7小时视频。
这篇论文指出,现有多目标强化学习训练大模型时存在"一刀切"分配优化精力的问题,提出SA-MRPO方法,根据每个奖励目标的饱和程度动态调整其权重,在数学推理、自适应推理、代码生成等任务上均取得优于现有方法GDPO的效果。