微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 香港中文大学、上海交通大学和阿里巴巴联合打造的AI"侦探":让机器像人一样主动去"找"答案,而不是被动地看完整段视频

香港中文大学、上海交通大学和阿里巴巴联合打造的AI"侦探":让机器像人一样主动去"找"答案,而不是被动地看完整段视频

2026-06-22 11:37
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-22 11:37 科技行者

这项由香港中文大学、上海交通大学与阿里巴巴集团Qwen团队联合开展的研究,于2026年6月以arXiv预印本形式发布(编号arXiv:2606.19341),并已被ICML 2026国际机器学习大会正式接收。感兴趣的读者可通过该编号查询完整原文。

当你拿着一本厚达500页的侦探小说,要找出一个藏在某一页的关键线索时,你会怎么做?一种方法是从第一页翻到最后一页,一字不漏地读完。另一种方法是根据已知信息,先翻目录,定位到最可能的章节,再精准锁定那一页。显然,第二种方法聪明得多。

然而,现在绝大多数负责"看视频、回答问题"的AI系统,都在用第一种方法——把整段视频从头看到尾,不管问题难不难、视频多不多长。对于一分钟的短视频,这还好说;但对于一小时、两小时,甚至更长的视频,这种"无差别扫描"的代价就变得极其高昂,计算资源消耗巨大,而且效果并不一定好。

正是为了解决这个问题,来自香港中文大学、上海交通大学和阿里巴巴Qwen团队的研究人员提出了一个名叫OmniAgent的全新框架。它的核心思想,就是让AI不再被动地"看完整段视频",而是像一个经验丰富的侦探一样,根据手中的问题,主动决定"去哪里找线索"、"何时需要听一段对话"、"何时需要仔细查看某个画面"。研究团队将这种能力称为"主动感知",而OmniAgent正是第一个将这种能力完整内嵌于单一模型的多模态智能体。

一、为什么现有的AI看视频会"累"

回到侦探的比喻。现有的大多数视频理解AI,相当于一个工作方式极其笨拙的侦探——他必须把整个案发现场的每一寸地方都扫描一遍,哪怕嫌疑人的证据明明就在门口的脚垫底下。这种"无差别扫描"在短视频时代还能应付,但随着视频越来越长,问题就暴露出来了。

计算代价随视频时长几乎呈超线性增长,意味着视频翻倍,计算量可不只是翻一倍那么简单。对于一小时以上的长视频,现有的被动模型往往要么因为内存限制无法处理,要么只能以极低的采样频率"走马观花",关键细节因此大量丢失。

有些研究团队意识到这个问题,尝试引入"工具调用"的方式——让AI作为指挥官,调度外部的专用工具来处理特定任务,比如用专门的语音识别模块来转录音频,再把转录结果交给AI分析。这种方式虽然缓解了一部分压力,但也切断了AI自身感知与推理之间的直接联系,就像侦探只能通过助手的二手描述来了解现场,而不是亲眼目睹。

另一些方案则给AI增加了"变焦镜头"——让它能够对视频的某个时间段放大精看。但这类方法通常仍然需要先对整段视频做一次全局扫描,才能决定"去哪里放大",全局扫描的成本并没有真正消除。

OmniAgent的研究团队意识到,要真正解决长视频理解的瓶颈,必须从根本上改变AI与视频的交互方式:不是"先看完再分析",而是"边分析边决定看哪里"。

二、OmniAgent的工作方式:像侦探一样"按需取证"

OmniAgent的核心运作方式,可以用一个侦探办案的场景来完整理解。

当一位侦探接到一个案子时,他不会先把整个城市的监控录像都调来看一遍。他会先从案情描述中提取关键信息——比如"案发时间是晚上10点"、"嫌疑人穿着蓝色外套"——然后有针对性地调取特定时段、特定地点的录像,听取关键证人的证词,必要时再去现场核实某个细节。每一步行动都基于当前已知信息,每一步都在缩小"证据空间",最终在掌握足够确凿的证据后,给出结论。

OmniAgent的工作方式与此如出一辙。研究团队将这个过程形式化为一个数学框架,叫做"部分可观测马尔可夫决策过程"(POMDP)。但不必被这个名字吓到——它的实际含义非常直观:AI每次只能观测到视频的一小部分(就像侦探每次只调取一段监控),必须根据当前观测结果和历史记忆,决定下一步去哪里"取证"。

具体来说,OmniAgent每一轮都会执行三个步骤,构成一个"观察-思考-行动"的循环。在观察阶段,AI把刚刚看到或听到的内容,提炼成一段精简的文字记录,就像侦探在笔记本上写下"22:03,监控显示一名蓝衣男子进入大厅"。在思考阶段,AI结合已有的所有笔记和当前观察,分析还缺少哪些证据、下一步应该去哪里找。在行动阶段,AI选择一个具体操作:可以是"截取视频第X秒到第Y秒之间的N帧画面",也可以是"提取某段时间的音频",还可以是"获取某段时间的完整视频片段(画面加声音同步)",或者是"我已经有足够证据,给出最终答案"。

每次行动之后,AI只保留提炼好的文字笔记,而原始的图像、音频数据会被清除出"工作记忆"。这个设计至关重要——它意味着不管视频有多长,AI的"记忆负担"始终只是它自己写下的文字笔记,而不是堆积如山的原始视频帧。就像侦探的笔记本不会因为调取了100段监控而变成100段视频,笔记本里记录的永远是精炼的关键信息。

这种设计带来了一个优雅的特性:推理的复杂度与任务难度挂钩,而不是与视频时长挂钩。一个简单的问题(比如"视频开头出现了什么颜色的气球"),可能只需要一两轮行动就能回答;一个复杂的问题(比如"整个会议中,哪位发言人的观点与主席立场最为对立"),则需要更多轮的取证与推理。AI会根据任务本身的难度,自适应地分配"推理步数",就像老练的侦探知道简单案子不用大费周章,复杂案子才需要步步深挖。

三、两阶段训练:先"教规矩",再"练功夫"

打造一个能像侦探一样主动取证的AI,并非易事。研究团队设计了两个递进的训练阶段,第一阶段叫做"主动感知监督微调",第二阶段叫做"主动感知强化学习"。

第一阶段,相当于给AI一个"新手训练营"。研究人员准备了五个视频问答数据集,涵盖选择题、数值推理和时间定位三类任务。但他们没有直接把问题和答案喂给AI让它死记硬背,而是让一个"教师模型"先去实际操作——在视频环境中按照"观察-思考-行动"的循环探索,尝试各种取证路径,最终找到正确答案。这个过程中,教师模型会产生大量探索轨迹,其中包括一些失败尝试——比如查询了一个超出视频时长的时间戳,系统返回了错误提示,教师模型随即自我纠正,换了一个合理的时间段重新尝试。

研究团队特意保留了这些包含"犯错和纠错"的轨迹,因为只有这样,训练出来的AI才能学会把错误信息当作"可利用的线索",而不是把它当成灾难性的失败。这种处理方式防止了一种叫做"教师强迫偏差"的问题——如果训练数据只包含完美无误的操作步骤,AI在真实推理时遇到任何小挫折都会不知所措。

此外,研究团队还对这些训练轨迹实施了两轮质量筛查。第一轮检查结果是否正确——对于选择题和数值题,要求精确匹配;对于时间定位任务,要求预测的时间段与真实答案的重叠度达到50%以上。第二轮则更深入,引入GPT-4o对每一条推理轨迹的"内在逻辑连贯性"打分——即AI当时的思考内容,是否真的有理有据地建立在它此前观察和记忆的基础上?凡是"蒙对了答案但推理牵强"的轨迹,一律剔除。经过这两轮筛选,最终保留了58,000条高质量训练轨迹。

第二阶段的强化学习训练,针对的是第一阶段没有解决的"难题"——那些教师模型探索了很多次都没能成功解答的问题。研究团队专门用这批"硬骨头"来训练,让AI通过不断尝试和接受奖励信号,自己摸索出更聪明的取证策略。

然而,标准的强化学习方法(具体来说是GRPO,即"组相对策略优化")在这里遇到了一个棘手问题:它对AI每一轮的"贡献"打分时,用的是整条轨迹的最终得分。换句话说,不管这轮AI是做出了关键性的发现("终于找到了嫌疑人出现的那段录像!"),还是执行了一个毫无信息量的重复扫描,都会得到同样的"功劳"评价。这就好比一个侦探团队,无论谁找到了突破性证据,还是谁只是重复了别人已经做过的工作,最后都按照"案子破了没"来统一发奖金——那么打破僵局的那个关键行动,就永远得不到应有的激励。

研究团队把这个问题命名为"优势均质化",并为此设计了一个专门的解决方案,叫做TAURA(即"轮次感知自适应不确定性重缩放优势")。TAURA的核心思路,是用AI在每一轮输出时的"困惑程度"(专业上叫"熵")来衡量这一轮的"决策重要性"。

直觉上,这个思路非常合理:当AI面临真正的岔路口——比如它刚刚从音频中听到了关键信息,正在权衡下一步是去核实画面还是继续听后续音频——它的内心会是犹豫不决的,表现为输出分布更加"扁平"(高熵)。而当AI执行一个程序性的常规步骤时,它的输出会更加确定(低熵)。TAURA正是利用这种"熵差",将功劳评分向那些高熵的关键轮次倾斜:做出了正确关键决策的轮次,得到额外加分;在不确定时刻做出错误判断的轮次,则受到额外惩罚。这样,AI就会逐渐学会在真正重要的岔路口更加谨慎和精准,而不只是机械地执行重复动作。

研究团队通过实证分析支撑了这个设计:在VideoMME基准测试的成功轨迹中,由专家模型(Gemini-2.5-Pro)标注出的"关键决策轮次"中,有79.2%的轮次确实表现出比该轨迹平均熵值更高的熵。这个比例有力地证明了用熵来识别"关键时刻"的可行性。

四、测试成绩:7B模型击败10倍大的72B模型

OmniAgent的表现,在十个不同的基准测试上得到了系统性验证,涵盖普通视频理解、长视频理解、音视频联合推理以及时间定位四大类任务。

在长视频理解的核心指标LVBench上,OmniAgent-7B取得了50.5%的成绩,而同等规模(7B参数)的基础模型Qwen2.5-Omni只有43.0%,提升幅度达到7.5个百分点。更引人注目的是,OmniAgent-7B不仅超越了所有同等规模的开源模型,还超越了参数量整整大出10倍的Qwen2.5-VL-72B(后者成绩为47.3%)。与此同时,OmniAgent平均只需采样约203帧视频,而Qwen2.5-VL-72B需要采样768帧——前者用了后者约四分之一的帧数,却取得了更高的准确率。

在另一个以多任务长视频理解著称的MLVU基准测试上,OmniAgent达到了71.1%,相比基础模型提升了5.9个百分点,也超越了近期以"深度推理"著称的Video-R1模型(后者在MLVU上为60.9%)。这个对比颇有意思:Video-R1依赖在固定输入上做更长更复杂的推理链,而OmniAgent则选择主动去补充缺失的视觉信息,两种策略的差异在长视频任务上被充分放大——对于长视频而言,信息的"不完整"往往比"推理不够深"更是瓶颈所在。

在需要同时理解画面和声音的音视频联合推理任务上,OmniAgent同样表现出色。在DailyOmni测试上,它以64.8%的成绩超越基础模型4.7个百分点;在OmniVideoBench上,提升幅度更达到7.8个百分点。这两个任务要求模型同时分析对话内容、背景声音与视觉画面,OmniAgent通过"先听关键音频、再用音频内容指引视觉搜索"的策略,将声音线索转化为精准的视觉定位工具,展现出真正的跨模态协同能力。

时间定位是视频理解中公认的难题,要求模型精确指出某个事件在视频中发生的起止时间。在LongVALE基准测试上,OmniAgent相比基础模型取得了高达33.4个百分点的绝对提升,在VUE-TR上的提升也达到33.0个百分点。更难得的是,OmniAgent-7B在VUE-TR上的成绩,甚至超越了GPT-4o和Gemini-2.5-Pro等顶级商业模型。研究团队认为,这一优势来自OmniAgent的"由粗到细"策略:它不是一次性从全局视角猜测事件位置,而是先粗略定位可疑区间,再逐步缩小范围,像调焦镜头一样对准目标时刻。

五、越推越准:验证"越想越聪明"的特性

OmniAgent的一个重要特性,是研究团队所说的"测试时正向扩展"——简单来说,就是给AI更多"思考步数"的机会,它的答案就会越来越准。

研究团队在VideoMME-Long子集上做了一个系统性实验:将AI最多允许执行的轮次上限K,从6步依次扩展到52步,观察准确率的变化。结果显示,随着K的增加,准确率从53.4%单调攀升到59.6%,提升了6.2个百分点。

更值得关注的是另一个数据:即便K被放宽到52,AI实际执行的平均轮次只有约11.7轮,远低于上限。这说明AI并不会为了"用完预算"而无谓地采取额外行动,而是在觉得"证据已经足够"的时候,主动发出终止信号给出答案。这个特性表明,推理深度由任务本身的难度决定,而不由最大轮次限制决定——就像一个有经验的侦探,不会因为还有时间就继续漫无目的地翻查,而是在握有足够证据时果断结案。

此外,研究团队还分析了视频时长对AI性能的影响。在LVBench的测试中,视频时长从约30分钟跨越到约130分钟,AI使用的平均轮次只从8.5轮增加到12.5轮,每小时的取证密度从16.9轮降至5.7轮,但准确率始终保持在50%左右,没有明显下滑。这意味着视频变长了4倍多,计算成本只增加了不到1.5倍,而效果几乎没有损失——真正实现了研究团队所期望的"推理复杂度与视频时长解耦"。

六、消融实验:每个设计选择都有价值

为了证明OmniAgent每个设计环节都切实有效,研究团队做了系统性的消融实验——也就是依次"拆掉"某个设计组件,看性能会如何变化。

对比普通监督微调与主动感知监督微调的差异时,结果颇为直观:在LVBench上,用普通方式微调之后,模型的成绩从基础线43.0%反而下滑到41.6%。这说明在没有主动选择机制的情况下,给模型喂入更多长视频训练数据,反而会造成"信息过载",让模型更难处理极长视频。而引入主动感知的OTA训练框架后,LVBench成绩跳升到48.7%,DailyOmni成绩也从60.1%提升到63.3%。

将TAURA与普通GRPO对比时,差异同样清晰:使用普通GRPO,MLVU成绩停滞在69.9%,DailyOmni甚至从63.3%轻微下降到62.2%。普通GRPO给每一轮行动分配的"功劳"是一样的,关键发现时刻因此被淹没在平庸行动的平均效果中。引入TAURA之后,MLVU提升到71.1%,DailyOmni达到64.8%,体现了精细化的信用分配对多轮推理任务的实质性帮助。

七、论文附录中的细节:系统如何在实际运行中管理记忆

研究团队在论文附录中还详细描述了OmniAgent环境的技术实现,这些细节有助于理解框架在实际运行中的可靠性与效率。

整个系统基于Ray分布式计算框架构建,支持多个推理过程并行运行,避免了大规模训练时的内存瓶颈。视觉帧的提取使用FFmpeg工具,采用"先关键帧粗定位、再精确解码"的两步策略,确保帧提取时间精度在毫秒级。音频片段被转换为标准的16kHz单声道WAV格式。视频片段则使用libx264编码,并在系统负载高时自动切换到更快但精度稍低的编码预设,确保交互流畅。

记忆管理机制是整个框架的核心保障之一。每次AI完成一轮取证行动并提炼出文字观察后,系统会自动清除该轮次输入的原始多媒体内容,只保留AI自己写下的文字笔记,同时在历史记录中留下一条"媒体内容已省略,请参阅对应轮次的观察记录"的提示。这种机制确保了不管视频多长、经历多少轮取证,模型的实际计算负担始终维持在一个可控的范围内。

在训练阶段,研究团队还对AI使用的参数引入了随机化:取帧数量在30到60之间随机选取,音频长度在150到300秒之间随机选取,视频片段长度在30到60秒之间随机选取。这种随机化让AI学会了在不同资源条件下灵活应对,而不是只会在固定设置下操作。

说到底,OmniAgent这项研究讲述的是一个关于"聪明工作"的故事。与其让AI把整段视频从头扫到尾,不如教它像一个有经验的侦探那样,用最少的取证步骤,找到最关键的证据。香港中文大学、上海交通大学和阿里巴巴Qwen团队的研究人员,通过精心设计的训练流程和奖励机制,让一个7B参数的小模型,在长视频理解这条赛道上超越了体量大出10倍的竞争对手。

这对普通人意味着什么?当未来的智能助手能够处理更长、更复杂的视频内容时——无论是法庭录像的关键片段定位、医疗手术录像的异常事件检测,还是长篇纪录片的智能摘要——背后的技术逻辑,可能正是这种"主动取证、按需感知"的范式。一个不需要看完整段视频就能找到答案的AI,在现实世界的应用价值,远比能看完更多帧视频的AI更大。

当然,这项研究也坦承了一个现实局限:逐轮交互的方式,会引入一定的延迟——每次取证都要等待结果返回,再决定下一步。论文末尾提到,研究团队计划未来探索"并行探索"的方式,让多路取证同时进行,从而缩短整体响应时间。这也是这个领域下一步值得关注的方向。

如果你对这项研究的细节感兴趣,可以通过arXiv编号arXiv:2606.19341查阅完整论文,代码和模型权重也已开源于GitHub和Hugging Face平台(OmniAgent-SFT-7B与OmniAgent-RL-7B)。

Q&A

Q1:OmniAgent是什么类型的AI模型,和普通视频理解模型有什么区别?

A:OmniAgent是一个"主动感知"型多模态智能体,与普通视频理解模型最大的区别在于交互方式。普通模型会把整段视频从头处理到尾,计算成本随视频时长线性增长。OmniAgent则像侦探取证一样,根据问题内容,主动决定去视频的哪个时间段截取画面、提取音频或获取片段,每次只处理当前需要的内容,并把提炼后的文字笔记积累成记忆,不保留原始多媒体数据,从而将推理复杂度与视频时长解耦。

Q2:TAURA是什么,为什么普通强化学习方法在多轮推理中效果不好?

A:TAURA全称是"轮次感知自适应不确定性重缩放优势",是专门针对多轮推理任务设计的强化学习改进方案。普通GRPO方法的问题在于,它用整条轨迹的最终得分来平均评价每一轮行动的"贡献",导致关键决策时刻和平凡重复步骤得到同样的奖励,关键行动无法被有效激励。TAURA通过检测每一轮输出的"熵"(即AI有多"犹豫不决")来判断该轮的决策重要性,将奖励信号集中分配给真正的"关键岔路口"轮次,使AI更精准地学会在重要时刻做出正确选择。

Q3:OmniAgent在LVBench上为什么能以7B参数击败72B参数的模型?

A:核心原因在于"主动感知"策略带来的信息质量优势。72B参数的被动模型通过密集采样768帧来尽量覆盖整个视频,但大量帧是与问题无关的冗余信息,实际有效信号被淹没。OmniAgent-7B平均只使用约203帧,但这些帧是根据问题内容有针对性地取证得到的,每一帧都与待解决的问题密切相关。换句话说,主动感知相当于一个"信息密度放大器",使小模型能够以更少的资源获取更高质量的输入,最终在长视频理解任务上以少胜多。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-