微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 武汉大学、北京大学、南洋理工大学等高校联合研究:AI终于学会了"把整场戏都找出来"

武汉大学、北京大学、南洋理工大学等高校联合研究:AI终于学会了"把整场戏都找出来"

2026-06-11 13:05
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-11 13:05 科技行者

这项由武汉大学、北京大学、南洋理工大学和新加坡国立大学联合开展的研究,以预印本形式于2026年6月4日发布,论文编号为arXiv:2606.06294,有兴趣深入了解的读者可通过该编号查询完整论文。

你有没有遇到过这样的情况:想在一段长视频里找到某个人"所有摔倒的片段",或者想把一部纪录片里"所有出现鸟类飞翔的瞬间"剪辑在一起?如果你曾经试过让现有的AI工具帮你做这件事,多半会失望而归——它只能找出"第一个"或者"某一个",而不是"所有的"。这个看似简单的需求,其实一直是视频AI领域里一块难啃的骨头。

这项研究正是为了解决这个问题而生。研究团队把这个任务命名为"一对多时间定位"(One-to-Many Temporal Grounding,简称OMTG)——就是说,给AI一段视频和一个文字描述,让它把视频里所有符合这个描述的时间段都找出来,而不仅仅是找一个。

为了把这件事做好,研究团队一共做了三件大事:建立了第一个专门测试这个能力的评测基准,制作了一个包含五万六千个样本的训练数据集,并且设计了一套全新的训练方法,最终让他们的模型在这个任务上远远超越了谷歌的Gemini 2.5 Pro和字节跳动的Seed-1.8等业界顶尖系统。

---

一、为什么"找一个"和"找所有"是完全不同的难题

以一道菜的烹饪教学视频为例来理解这个问题。假设这个视频里,厨师前后三次把食材放进锅里翻炒,你想找出所有翻炒的时刻。现有的大多数AI视频工具,就像一个只会背课文第一段的学生——它能告诉你"翻炒从第15秒开始、到第28秒结束",但完全忽略了第二次在第45秒、第三次在第72秒的翻炒动作。

这不是偶然的疏忽,而是根本的设计缺陷。过去绝大多数的视频AI都是按照"一个问题对应一个答案"的逻辑设计的,好比考试只会出单选题,从没想过要出多选题。研究团队在测试中发现,Qwen2.5-VL等主流开源模型在这个任务上的得分几乎为零——它们面对多段答案的问题,完全不知道该怎么办。

更棘手的是,就连评测这件事本身也不简单。过去评价视频AI找时间段是否准确,常用一个叫"时间交并比"(tIoU,你可以理解为"重叠率")的指标:预测的时间段和正确答案重叠越多,分数越高。但这个指标在"找所有段"的任务下会产生严重的误判。

研究团队用两个生动的反例来说明这一点。第一个反例:正确答案是视频里有四段"男人对着摄像头说话",分别在第3-32秒、第33-55秒、第56-64秒和第65-86秒。但某个AI把这四段合并成了一段,直接输出"第1-86秒"。按重叠率算,这个答案的得分高达0.94分(满分1分),看起来相当准确——但实际上AI完全没有理解这里有四次独立的说话行为,它的回答从根本上就是错的。第二个反例是相反的情况:正确答案只有两段,AI却输出了四段,"凭空"多找了两段不存在的内容——这叫做"幻觉"(hallucination)。这种多找的答案重叠率也可以高达0.9,但同样是完全错误的回答。

由此可见,需要一套全新的评测标准。

---

二、全新的评测尺子:不只看重叠,还要数清楚有几段

研究团队设计了三把新尺子来衡量AI在这个任务上的表现,每把尺子从不同角度打分,合在一起才能给出公正的评价。

第一把尺子叫"时间F1分数"(tF1),它借鉴了信息检索领域里经典的"精确率-召回率"平衡概念。精确率衡量的是"AI找出来的东西有多少是对的",召回率衡量的是"正确答案里有多少被AI找到了",而F1就是这两者的综合平均。打个比方:一个猎人去森林里找松鼠,如果他抓了10只,其中8只是松鼠,精确率就是80%;如果森林里总共有20只松鼠,他找到了其中8只,召回率就是40%;F1就是把这两个数字综合起来得到的53%左右。这个指标能同时惩罚"多找了假段"和"漏掉了真段"两种错误。

第二把尺子叫"计数准确率"(C-Acc),顾名思义,就是直接检查AI预测的段数是否和正确答案的段数完全一致。正确答案是4段,AI也说4段,就得1分;说3段或5段,就得0分。这个指标专门考察AI有没有"数数的能力",也就是能不能感知到一个事件究竟在视频里出现了几次。

第三把尺子是最严格的,叫"有效时间F1分数"(EtF1),它是把前两把尺子叠加在一起:只有当AI预测的段数和正确答案完全一样时,才开始计算F1分数;只要数量错了,这道题直接得0分。这就好比一道数学大题,解题过程正确但最终答案写错了数字——就算过程再精彩也不能给满分。这是整个评测体系里最核心的指标,因为它同时要求AI既要数对,又要找准。

有了这三把尺子,研究团队还建立了一个包含340道手工标注题目的评测基准库,题目来源涵盖体育、烹饪、新闻等多个领域,视频时长从21秒到17分钟不等,难度分布也很有挑战性——其中15%的题目正确答案超过6段,专门用来考验AI的计数极限。

---

三、从哪里找来五万六千道练习题

有了评测标准,下一步就是给AI找足够多、足够好的练习材料。研究团队设计了一条五个步骤的自动化数据生产流水线,整个过程像一条精密的工厂生产线,每个环节都有严格的质检程序。

流水线的第一步是"找出哪些事情反复出现"。团队用一个叫做Qwen3-VL-235B的强力AI模型逐个扫描原始视频,让它自动发现视频里反复出现的有趣事件,并为每个事件生成一个文字描述。比如,它可能在一段驾驶视频里发现"戴墨镜的男人在开车"这件事反复出现了三次。

第二步是"给每件事标出时间"。用上一步生成的文字描述作为查询,让谷歌的Gemini 2.5 Pro来做初步的时间定位,让它把每个事件在视频里所有出现的时刻都标注出来,得到初步的时间标签。

第三步是最关键的质检环节,叫做"严格视觉核查"。团队把第二步标注的每一段视频片段都单独剪出来,再交给Qwen3-VL-235B去核查——它需要独立判断这段视频是否真的符合对应的文字描述。这里有一个非常严格的"一票否决"规则:只要一个样本里的任何一段视频片段没有通过核查,整个样本就会被直接丢弃,哪怕其他段都完全正确也不行。研究团队通过数学推导证明,这个机制对于包含多段视频的样本质量提升效果是指数级的——对于包含四段的样本,质量提升幅度约是包含两段样本的七倍。

第四步是"补漏洞和打磨描述"。经过第三步筛选存活下来的样本,还需要进行进一步的精炼。团队再次用Gemini 2.5 Pro来做两件事:一是检查有没有遗漏某些实际发生但没被标注到的片段(补漏),二是把文字描述改得更精准、更无歧义(打磨描述)。

第五步是"生成密集的画面旁白"。最后,用Qwen3-VL-235B为每段视频生成极为详细的逐秒描述,就像体育解说员在逐帧解说一场比赛。这些详细的画面旁白将在后续的训练过程中起到辅助推理的作用——它们能帮助AI在脑子里先"写下"看到了什么,再从这些描述中推断出目标事件的时间范围。

这条流水线最终产出了56,000个高质量的训练样本,其中46,000个用于第一阶段的"有监督微调"训练,剩下10,000个用于第二阶段的"强化学习"训练。

---

四、两阶段训练:先打基础,再用奖惩雕琢

得到了训练数据之后,研究团队采用了一种"先教后练"的两阶段训练策略。

第一阶段叫"有监督微调"(SFT),可以理解为给AI上标准课程。研究团队把所有的训练样本喂给AI,让它学习正确答案是什么样的。在这个阶段,AI学会了一种特殊的思考方式:在给出最终时间答案之前,先生成一段详细的画面旁白,描述视频里每个时间段发生了什么,再从这段文字描述中推断出目标事件的时间段。这就像侦探在下结论之前,先把现场所有的线索逐一记录下来,然后再从记录中推断嫌疑人。

经过第一阶段训练,基础模型的EtF1分数从0.21分飙升到34.81分,说明SFT已经让AI具备了基本的"一对多"定位能力。但研究团队发现,单靠有监督训练,AI在精确度和召回率的平衡上仍然不够稳定——有时候找不全,有时候又找多了。

第二阶段叫"强化学习"(RL),可以理解为给AI布置实战练习并根据成绩打分。在这个阶段,AI不再只是跟着答案死记硬背,而是通过不断尝试、接受评分、调整策略来提升自己。研究团队设计了一套组合奖励函数,相当于给AI设立了多个考核维度。

这套组合奖励由四个部分构成。第一部分是"时间重叠奖励",直接奖励AI找到的时间段和正确答案的重叠程度,鼓励AI把时间边界定得更准。第二部分是"计数准确奖励",只有当AI预测的段数和正确答案完全一致时才给满分,哪怕只差一段也不得分,这个机制专门逼迫AI学会准确感知事件出现的次数。这两部分合在一起组成"时间奖励",在实验中发现,单有第一部分几乎不能提升计数能力,但加入第二部分后,计数准确率大幅提升。

第三部分是最有创意的"字幕奖励"。研究团队引入了另一个AI(Qwen3-30B-A3B)作为评判官,专门评价AI在推理过程中生成的画面旁白质量。这位评判官会从三个角度打分:一是"覆盖度",检查旁白里有没有提到正确答案中所有的事件;二是"精确度",检查旁白的时间边界有没有对准正确答案;三是"区分度",检查每段旁白是否包含足够独特的信息来帮助区分不同的事件发生。除此之外,评判官还会做一件特别有趣的事:只看AI写的旁白文字(不看视频),然后尝试从这段文字中推断出目标事件的时间段,如果能推断出来,就说明这段旁白确实包含了足够丰富的时间信息。这个机制确保了AI的"推理过程"不是在走过场,而是真正在帮助解决问题。

第四部分是"长度惩罚",专门惩罚AI写出过于冗长的答案——如果旁白太长,就会从总分里扣分,这样可以防止AI用废话填充来干扰核心的时间定位。

经过强化学习阶段,EtF1分数从34.81进一步提升到43.65,计数准确率也从44.06%跳升至55.63%。

---

五、成绩单:碾压顶级商业AI的小模型

最终的成绩让人印象深刻。研究团队训练出的模型被命名为OMTG-4B(参数量约40亿),在评测基准上的EtF1得分为43.65%。

相比之下,谷歌的Gemini 2.5 Pro得分27.80%,谷歌更新的Gemini 3 Pro得分21.30%,字节跳动的Seed-1.8得分28.04%。OMTG-4B在这个任务上的得分比这些动辄千亿参数的顶级商业AI高出了15个百分点以上。

那些连基础OMTG能力都没有的开源模型情况更糟:Qwen2.5-VL系列不论3B还是72B参数的版本,计数准确率都是0%,EtF1得分也都是0分。即便是更新版本的Qwen3-VL系列,最大的235B参数版本计数准确率也只有0.31%,EtF1接近零。

研究团队还专门验证了一件事:针对"找多段"任务的专项训练,会不会让AI在传统的"找一段"任务上退步?结果令人惊喜——不仅没有退步,在Charades、ActivityNet、QVHighlights三个经典单段定位基准上,OMTG-4B的表现都超过了基础模型,其中强化学习阶段的提升尤为明显。这说明学会"把所有出现都找出来",反而让AI对每个单独事件的理解也更深刻。

为了进一步验证泛化能力,团队还从B站和YouTube收集了60段完全没有被训练过的真实视频,平均时长超过七分钟。OMTG-4B在这些视频上的EtF1得分为22.10%,而Gemini 2.5 Pro和Gemini 3 Pro分别只有4.81%和3.29%。面对从未见过的真实世界视频,差距依然显著。

---

六、这套方法的边界在哪里

当然,这项研究并非无懈可击。研究团队自己也坦承,训练成本较高,在处理极长视频时面临扩展性挑战。他们在附录中还展示了一个典型的失败案例:在一段厨房视频里,正确答案是找出"人移动冰箱门"这个动作在9-12秒和22-24秒各发生一次,共两段。但OMTG-4B的推理过程虽然正确识别出了两次不同的冰箱门动作,最终却只输出了一段答案(22-24秒),好像在"想清楚了"之后又在最后一步犯了错。这类"思考对了、嘴上说错了"的问题,反映出AI在将推理结果转化为最终输出时仍然存在不稳定性。Gemini系列则表现出另一种失败模式:把开冰箱、拿东西、关冰箱这整个过程当成一件连续的事,输出了一个从第6秒到第24秒的长段,完全没有意识到"打开门"和"关上门"是两个独立的"移动冰箱门"动作。

研究团队也指出,未来需要解决的问题之一是如何在超长视频中有效处理这个任务——当视频时长达到一两个小时时,如何让AI既不遗漏任何一次事件出现,又不凭空产生幻觉,依然是一个开放的挑战。

---

归根结底,这项研究做的事情,是把一个看似简单却被长期忽视的问题——在视频里找出某件事的所有出现时刻——认真地当成一个独立的研究课题来对待,并提供了一整套完整的解决方案:从评测标准到训练数据,再到训练方法,形成了闭环。对于普通用户来说,这意味着未来的视频搜索工具或许真的能够回答"帮我找出这部球赛里所有的进球时刻"或"把这段教程视频里所有老师示范操作的片段剪出来"这样的需求,而不是只给你一个片段、让你自己再去慢慢翻。这方向是对的,距离真正好用的产品还需要时间,但迈出这一步本身,已经不容易。

有兴趣深入研究技术细节的读者,可以通过论文编号arXiv:2606.06294查阅完整原文。

---

Q&A

Q1:一对多时间定位(OMTG)和普通的视频时间定位有什么区别?

A:普通的视频时间定位是"一个问题找一个答案",比如找出视频里"某人第一次出现的时段"。一对多时间定位则要求找出"所有符合条件的时段",比如找出视频里某人出现的每一次时段,不能遗漏任何一次。这个区别看似简单,但对AI来说是完全不同的能力挑战,因为AI不仅要找准每段的时间边界,还要准确感知到目标事件一共出现了几次。

Q2:为什么用重叠率(tIoU)评价一对多时间定位会产生误判?

A:重叠率只关心预测时间段和正确时间段的重叠面积,不关心段的数量是否正确。如果正确答案是4段,AI把它们合并成1段,重叠率可能高达0.9以上,看起来很准确,但实际上AI完全没有理解事件的分段结构。反过来,AI多预测了几段不存在的内容,重叠率也可能虚高。因此EtF1这个新指标专门要求AI预测的段数必须和正确答案完全一致,否则直接零分,才能真正衡量AI是否真正理解了视频内容。

Q3:OMTG模型的字幕奖励机制是怎么工作的?

A:字幕奖励的核心思路是用另一个AI来评判"推理过程的质量"。被训练的AI在给出时间答案之前,需要先生成一段详细描述视频内容的文字。评判AI会检查这段文字是否覆盖了所有正确答案、时间边界是否精准、不同事件是否被清晰区分,以及最关键的一点:仅凭这段文字(不看视频),能否推断出正确的时间范围。这样可以确保AI的推理过程是真正有效的,而不是在走形式。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-