微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 一小时的视频,选八帧还是十六帧,差的不是数量,是逻辑

一小时的视频,选八帧还是十六帧,差的不是数量,是逻辑

2026-09-28 09:57
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-09-28 09:57 • 科技行者

你有没有想过,一部一小时的视频,如果按每秒一帧来拆,会变成三千六百张图片。而现在几乎所有能看视频的AI模型,其实都做不到把三千六百张图片全部塞进去分析。它们只能挑一小部分,可能是八张,可能是十六张,剩下的全部扔掉。

这件事说出来有点吓人。你问AI一个关于一小时视频的问题,它能给出答案,靠的可能只是从这一小时里随手抽出来的十几张照片。抽得好不好,直接决定了它是不是在瞎猜。

这篇论文做的事情,说起来朴素得让人意外:它没有提出什么惊天动地的新模型,而是老老实实地做了一件几乎没人做过的事情,把"选哪些帧""每帧给多少清晰度""省下来的资源怎么花"这三个决策,一个一个地单独拿出来测,看看到底哪个才是真正值钱的东西。

**结果是,选帧这件事,比你想象得重要得多。**

在长视频问答基准LongVideoBench的一小时视频集合上,用八帧精心挑选的画面,准确率反而比十六帧随便均匀抽取的画面高出6.9个百分点。也就是说,帧数减半,答案反而更准。

这是个挺反直觉的结果。正常人的直觉是,给AI看得越多,它应该越聪明,这不是常识吗?但这篇论文告诉你,如果看的东西是随便挑的,看得多不如看得准。

一、问题到底难在哪

先说说这个领域现在的处境。

市面上已经有不少论文在做"怎么选帧最好"这件事,取了各种花哨的名字:AKS、FOCUS、MDP3、Q-Frame,一个比一个复杂,报告的效果也一个比一个漂亮。但作者发现一个尴尬的事实,这些论文之间几乎没法真正比较。

为什么没法比?因为每篇论文在比较自己的方法和别人的方法时,往往悄悄换掉了好几个变量:换了打分用的视觉编码器,换了问题怎么喂给模型的方式,换了分辨率策略,甚至换了最后回答问题的那个大模型。你拿A论文的95分和B论文的90分比,看起来A赢了,但你根本不知道这5分是选帧算法带来的,还是编码器升级带来的,还是分辨率策略带来的。

这就像两个饭馆比谁家的招牌菜好吃,结果一家用的是进口牛肉配自家秘制酱料,另一家用普通牛肉配普通酱料,你尝完说"进口牛肉那家赢了",但你其实不知道赢的是牛肉还是酱料。

选帧算法*:从视频里众多候选帧中,挑出一小部分最有用的画面交给AI分析的规则或算法。

LongCLIP*:一种能理解长文本描述的图文匹配模型,论文中用它给候选帧和问题打相似度分数,判断哪些帧和问题最相关。

所以这篇论文干的第一件事,是把所有变量锁死,只留一个自变量。所有选帧方法,都用同一个打分器(LongCLIP)打分,都喂给同一个问题文本,都用同一个回答模型(Qwen3-VL-8B)来答题,都用同一套评测脚本跑分。在这种"公平赛道"上,再去比较六种不同的选帧规则谁更强。

二、一个七十年前的老算法,居然打平了最新方法

论文里最让人意外的角色,是一个叫OMP的算法。

正交匹配追踪*(Orthogonal Matching Pursuit,简称OMP):1993年提出的一种贪心稀疏近似算法,原本用于信号处理领域的信号重建,本身跟视频、跟AI完全没关系。

它的工作原理说起来很简单。假设你有一个"问题向量",代表这道题在问什么,你手头有一堆候选帧的向量。OMP第一步,选出和问题向量最相关的那一帧。选完之后,它做一个关键动作:把这一帧已经"解释"过的方向,从问题向量里减掉,剩下的叫"残差"。第二步,再从剩下的候选帧里,找和这个残差最相关的那一帧。如此反复。

这个设计的巧妙之处在于,它不是简单地找"和问题最像的前八张图",而是每选一张,就强制下一张必须去解释"还没被解释的部分"。这样选出来的八张图,天然地互相之间信息重叠更少。

这个逻辑,像不像你在准备一场没有提纲的考试,手头只有八张便利贴,可以摘录八条笔记?如果你每次都摘录"最重要的一句话",很可能八条笔记全都围着同一个知识点转,因为那个知识点确实最重要,但你把其他七个知识点全丢了。而更聪明的做法是,记完第一条最重要的,第二条你要问自己"哪一条是我还没记录、但对理解这道题仍然关键的",这样八条笔记能覆盖更广的知识面。OMP做的就是这第二种记笔记方式。如果不做这个"减去已选方向"的动作,选出来的帧会严重扎堆在视频里信息最密集、最显眼的那一段,漏掉散布在别处的关键线索。

结果是,这个三十多年前、专门为信号处理设计、跟视频毫无关系、完全没经过调参的老算法,在三个长视频基准测试上,比均匀采样高出5.7到11.8个百分点,并且和目前最新的专用选帧方法LDDR相比,差距不超过一个百分点。

这事儿的分量不只是"老算法还挺能打"。它说明,很多号称专门为视频设计的复杂选帧系统,它们的真实优势可能不是来自选帧规则本身的巧妙,而是来自它们背后配套的更强打分器、更精细的流水线。一旦把这些外部因素全部拉平,大家站在同一起跑线上,一个通用的、没有任何视频知识的老算法就能跟上。

这对读论文的人是个提醒:看到一篇论文说"我们的选帧方法比别人强10个百分点",先别急着信,得先问一句,你们用的打分器是不是也换了。

三、压缩清晰度,几乎不花代价

选完帧之后,论文测了第二件事:每一帧给多大的分辨率。

直觉上,画面越清晰,AI应该看得越明白。论文的做法是,固定住已经选好的那些时间点不变,把每帧的空间分辨率砍掉一半左右,看看答题准确率会不会掉。

结果是,在Qwen这个回答模型上,三个基准测试里,压缩后的准确率变化最大也就0.44个百分点,几乎可以忽略。

等效性检验*(Two One-Sided Test,简称TOST):一种统计方法,专门用来证明"两种做法几乎没有区别",而不是像常规检验那样只能证明"有区别"或"没能检测出区别"。

这里有个统计学上挺讲究的细节。论文没有简单说"没测出差异所以两者一样",因为"没测出差异"和"证明真的没差异"是两件不同的事。就像你去医院做检查,医生说"没查出问题"和"确诊完全健康"根本不是一个意思。所以论文额外做了等效性检验,给出一个正负三个百分点的置信区间,正式说明压缩前后的效果落在这个区间之内,基本可以认为是等效的。

这个发现挺有意思。它说明视觉信息里,清晰度这个维度,存在相当大的冗余。回答"视频里那个人穿的是什么颜色的衣服"这种问题或许需要高分辨率,但绝大多数问题需要的其实是"这一帧大概在讲什么场景",清晰度砍半基本不影响这个判断。

四、真正的价值,在于把省下来的东西花出去

如果分辨率能砍一半而准确率不掉,那省下来的那一半资源该干什么?

这才是整篇论文最有巧思的一步:把压缩省下来的视觉资源(术语叫"视觉token"),不是浪费,而是拿去多选一倍的帧数,让AI看更多的时间点。

视觉token*:多模态大模型处理图像时,会把画面切分并编码成若干个数字向量,每一个这样的向量单位就叫一个视觉token,数量越多意味着计算和显存开销越大。

具体操作是,原来八帧全分辨率,现在改成十六帧、每帧分辨率砍到大约一半。论文专门写了脚本去核算这两种方案实际消耗的token数量,确认十六帧压缩方案花的token,不比八帧全分辨率方案多,在两个测试集上分别是原方案的99.6%和98.4%,也就是说新方案反而更省一点。

在这个"不多花钱,还更省"的前提下,把八帧全分辨率换成十六帧压缩,LongVideoBench上准确率提升2.24个百分点,在更难的LVBench上提升3.04个百分点,统计显著性很强(p值小于0.001)。

这就像你手里有一笔固定的旅行预算,原本打算住一晚五星级酒店,后来发现如果换成住两晚普通酒店,两晚的总花费还比一晚五星级更低,而且你还能多逛一个城市。如果不做这个"重新投资"的动作,单纯砍分辨率省下来的钱就只是躺在账户里睡觉,什么用都没有,论文里也明确说了,压缩本身"不会白白带来收益",它的价值完全体现在你把省下来的东西重新投进去之后。

这也是论文标题"选择、压缩、再投资"里"再投资"这一步的分量所在。压缩不是终点,是给你腾出空间去做更有价值的事情的手段。

五、验证的严谨程度,值得单独拿出来说

这篇论文有个地方特别值得称赞,它不光提出方法,还花了大量篇幅去检验自己的实验设计到底靠不靠谱。

其中一个细节堪称"科研自曝家丑"的典范。作者团队在复现AKS这个基线方法时,代码里藏了一个bug。AKS的原理是递归地把时间轴切成多个小段,每段分配一小份帧配额,公式是每层配额等于总帧数除以2的层数次方。当帧数设为8、递归深度设为5时,按照这个公式算出来的配额是0,导致递归返回空结果,而作者写的兜底代码把这个空缺全部用最简单的余弦相似度排序(也就是top-k方法)填满了。结果就是,在最初的实验草稿里,AKS这一行数据其实和top-k方法一模一样,只是套了个AKS的名字。

他们是怎么发现的?不是靠人工检查代码,而是靠一个巧妙的交叉验证习惯:把不同方法选出来的具体帧的编号拿出来对比重叠度。他们发现AKS和top-k选出来的帧,重叠率高达98.5%,这个数字太反常了,两个理论上完全不同的算法,不应该选出几乎一样的帧。顺着这条线去查代码,才挖出了这个填充逻辑的bug。

修正之后,重新选出的帧里,大约99.5%都和之前不一样了,可以说几乎是重新选了一遍。但最终的整体准确率,在LongVideoBench上只变化了1.05个百分点,在LVBench上只变化了0.07个百分点。

这个数字对比特别值得琢磨。**99.5%的帧变了,总分只动了几个百分点甚至几乎不动。**

如果你只看总分这一个数字,你完全发现不了背后其实换了几乎所有的输入内容。这说明总分这种汇总指标,天然具有一种"藏污纳垢"的能力,它可以把巨大的内部变化压缩成一个几乎看不出异样的小波动。这也是为什么作者反复强调,以后做这类对比实验,一定要做"跨方法之间选帧重叠度检查",而不能只满足于每一行数据本身看起来合理。

六、两个"标准答案"之间,居然能差出三点几分

论文还揪出了另一个更让人后背发凉的问题:即便是同一套已发表的选帧规则、同一个测试预算、同一个打分编码器,换一个人重新跑一遍实验,得出的结果都可能对不上。

论文找到LDDR这篇之前的工作,它恰好在自己的对比表格里,标准化地用同一个编码器(LongCLIP)跑了所有基线方法,跟这篇论文的设定几乎完全一致。于是作者把自己重新跑出来的数字,和LDDR论文里报告的数字放在同一张表里对比。

结果是,九个可比较的格子里,有八个格子,这篇论文自己跑出来的提升幅度,比LDDR论文报告的要小,差距从0.07分到3.74分不等。

这个差距区间挺讽刺的,它几乎覆盖了整个学界用来判断"这个选帧方法到底有没有用"的分数量级。换句话说,同样的方法、同样的配置,不同的人跑出来的分数差异,可能比你要证明的那个效果本身还大。

这就像两家实验室用同一份配方做同一道菜,结果做出来的味道差了三分之一,而你原本想证明的正是"多放一勺盐能让味道提升三分之一"。如果连基本的复现都对不齐,那这一勺盐的功劳到底有多大,根本说不清楚。作者没有强行去解释谁对谁错,而是老实承认,均匀采样这个"起点"在两边就不一样,一个跑出28.08分,一个跑出34.54分,起点都不一样,后面比较的意义自然要打个问号。

这一发现的价值在于,它给整个领域敲了一个警钟:跨论文比较分数,风险比想象中大得多。这也是为什么这篇论文反复强调,所有的核心结论都必须是在同一个环境里做的"配对比较",而不是拿自己的数字去跟别人论文里的数字硬碰硬。

七、这套方法在不同模型上表现不一样

论文还测了一个容易被忽略但很实际的问题:同样一套精心挑选的帧,换一个回答问题的大模型,效果会不会一样好。

答案是不一样。用InternVL3这个模型家族重新跑一遍,选帧带来的提升在LongVideoBench和LVBench上都稳定复现了,但在Video-MME这个基准上出现了分裂,小模型(2B参数)在长中短视频上全都获益,大模型(8B参数)只在短视频上获益,中长视频上几乎没有变化,尽管它接收到的的确是完全不同的画面。

这说明选帧这件事的收益,不是一个放在哪里都成立的普适真理,它跟"哪个模型来读这些帧""在哪个测试集上问什么样的问题"绑定在一起。同一套帧,喂给不同的大脑,消化吸收的程度是不一样的。

八、这些结论传下去,会走向哪里

论文本身没有停留在"发现现象"这一步,还往前追问了背后的机制。作者做了一个几何分析,发现OMP在这个场景下起作用的方式,跟它在信号处理里的原始设计初衷其实不太一样。

模态差距*(Modality Gap):在图文对比学习模型(比如CLIP系列)中,文本向量和图像向量即便描述同一件事,在向量空间里的方向也往往差得很远,几乎接近垂直,这是这类模型的一个已知特性。

论文发现,文本问题的向量,和视频帧的向量几乎是垂直的,这意味着OMP那个"用选中的帧去解释问题残差"的核心机制,实际上根本没怎么起作用,残差几乎没有被显著削减。真正起作用的,是另一个副作用:OMP在选帧过程中,会天然地避免选到内容重复的帧。这个"去重"效果,恰好帮它在长视频里覆盖到更多不同的场景。

但这也带来一个副作用。论文做了一次探索性的失败案例分析,发现OMP选出来的第八帧,常常会跑偏到那些"画面很特别但跟问题完全无关"的地方,比如视频里毫不相关的片头、字幕卡、黑屏转场。这些帧确实"够独特",够多样,但对回答问题毫无帮助。这提示了一个未来的改进方向,选帧不应该无脑追求多样性,而应该在"和问题相关"的范围内去追求多样性,而不是在整条时间轴上漫无目的地追求多样性。

这个思路,后续在论文提到的相关工作里已经能看到雏形。比如ReQuest这个工作引入了不确定性触发的计算机制,试图让模型只在真正不确定的时候才去检索更多帧;QCA这个工作则按照视频片段来分配帧配额,结合内容差异度做更精细的控制。这些工作某种程度上都是在往"相关性约束下的多样性"这个方向靠近,只是论文本身没有直接去实现这个改进,而是把它作为一个开放问题留给了后续研究。

写在后面

读完这篇论文,最触动我的其实不是那个正交匹配追踪算法有多厉害,而是作者揪出自己实验里那个AKS的bug的方式。

他们没有靠人工审查代码找到问题,而是靠一个非常朴素的怀疑:两个理论上不同的方法,选出的帧重叠率高达98.5%,这不正常。这种警觉性,本质上是一种对"总分掩盖真相"的天然不信任。放在更大的范围看,这提醒我们,任何一个汇总性的评分体系,不管是考试分数、绩效指标还是模型准确率,都存在把巨大的内部差异压平成一个看似合理的数字的风险。分数一样,不代表过程一样。

另一个让我意外的地方是,那个跨越三十多年、原本活在信号处理教科书里的正交匹配追踪算法,居然能在2026年的视频大模型评测里跟最新的专用方法打得难分高下。这多少说明,很多所谓的"领域专用创新",其实核心增益点未必来自那个花哨的新机制,可能只是因为它搭配了更好的外部条件。这不是说创新不重要,而是提醒我们分辨清楚,增益到底来自哪里,这件事本身就值得单独拿出来做研究,而不是想当然地归功于表面上那个最显眼的新点子。

那么问题来了,如果一个三十年前的老算法能在选帧这件事上跟最新方法打平,下一个被"重新发现"的老工具会是什么?

Q&A

Q1:为什么长视频AI模型不能看完整个视频的所有帧?

A:因为一小时视频按每秒一帧算会拆成三千六百张图片,而模型受计算和显存限制,只能保留固定的一小部分帧,比如八帧或十六帧,剩下的全部丢弃,所以哪些帧被留下直接决定模型能看到什么。

Q2:正交匹配追踪算法为什么能在选帧任务上表现这么好?

A:因为它每选一帧后会把这帧已经解释过的信息方向从问题向量里减掉,再基于剩余部分继续选,这样选出的帧信息重叠更少,天然更分散、更全面,即便这个算法本身完全没有针对视频做过任何调整。

Q3:压缩画面清晰度省下来的资源应该怎么用最划算?

A:论文发现直接省着不用几乎没有意义,真正有效的方式是把省下来的资源拿去多选一倍数量的帧,在实测token开销不增加甚至更低的情况下,长视频问答准确率能额外提升两到三个百分点。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-