微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 AI给视频打分,能打出漏洞在哪里吗

AI给视频打分,能打出漏洞在哪里吗

2026-09-28 12:28
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-09-28 12:28 • 科技行者

你可能刷到过这样的AI生成视频:一个篮球从空中弹地,动作流畅得几乎看不出破绽,可仔细看第三帧,球好像从地板里穿过去了一点点。或者一段海豚跃出水面的画面,水花四溅,光影完美,但海豚的跳跃高度低得离谱,更像是在水面轻轻蹭了一下。

这些视频不是画质差,恰恰相反,它们的画质好到让你一开始根本没注意到问题。这就是现在AI视频生成面临的一个尴尬处境:视频越做越逼真,但逼真和"符合物理规律"完全是两回事。

现在业界评价一段AI视频好不好,主流做法是让另一个AI模型看一遍,打一个分数,比如"整体质量8.5分"。这个分数能告诉你什么?几乎什么都不能。它不会告诉你篮球是在第几秒穿墙的,不会告诉你违反的是哪一条物理定律,更不会告诉你这个判断是怎么得出来的。你只能拿到一个数字,然后自己去猜。

这篇来自卡内基梅隆大学、佐治亚理工学院和Adobe研究院团队的论文,提出了一套名叫VeriPhy的系统,试图解决这个问题。它的核心主张很直接:一个可信的评判,不该只给你一个分数,而应该告诉你到底哪里错了,错在什么时候,凭的是什么证据。

为什么这事没那么简单

你可能会想,这不就是让AI仔细看视频,然后写个报告吗?有什么难的?

难就难在,"仔细看"这件事,如果没有章法,很容易变成另一种形式的想当然。

想象你请一个不懂篮球规则的朋友帮你检查一段篮球比赛视频有没有犯规。他可能会盯着球员的表情看,盯着观众席看,却唯独没留意脚有没有踩线,因为他压根不知道该看哪里。现在主流的视频质量评估模型,面对一段视频时也是类似的处境:它没有一个明确的"检查清单",往往是把整个提示词和整个视频一起丢给一个大模型,让它凭直觉给出一个整体印象。这个印象可能受画面是否好看、构图是否讨喜这些无关因素影响,却未必真的核实了提示词里要求的每一件事是否发生。

论文里提到一种叫做"问题分解"的改进思路,做法是把一句提示词拆成几个可以用是非题回答的小问题,比如"画面里有没有一个自动售货机"。这确实比笼统打分进了一步,但论文的实测发现,这类方法很多问题只停留在"这个东西存在吗"的层面,靠看一帧画面就能回答,根本碰不到运动轨迹、接触碰撞这类真正需要连续观察的物理细节。

问题分解法*:一种视频评估方法,把提示词拆解成多个具体问题逐一向AI提问,再综合各个问题的回答给出整体评价,相比整体打分更精细,但问题本身的深度决定了评估的上限。

VeriPhy想解决的正是这个层次的问题:让检查这件事,从"凭印象"变成"按流程走",而且每一步都留痕迹,好让人能倒查回去。

先写检查清单,再看视频

VeriPhy最反常识的一个设计,是它的"规划"环节完全不看视频。

这话听起来有点奇怪。评估一段视频,难道不该先看看视频里有什么吗?但VeriPhy偏偏反过来:系统里有一个专门的文本规划器,拿到提示词后,在还没读入任何一帧画面之前,先把提示词拆解成一条条可以核实的物理主张,同时为每条主张写好检查方案,也就是该用什么工具、测量什么指标才能验证它。

这就像一个审计员在进场检查账目之前,先根据合同条款列出一份审计清单:这笔款项该核对发票,那笔支出该核对签字,清单写好之后才开始翻账本。如果反过来,边翻账边想查什么,很容易被账本上某一页特别工整的数字带偏,忽略了本该重点核查的那几笔。

VeriPhy的规划器做的就是这件事。它先通读整段提示词,给每个提到的实体和每个单独发生的事件建立一套统一的命名,避免后面检查的时候把两个不同的东西搞混,或者把同一个东西的两次出现当成两回事。然后把所有要核实的主张分成小组,每组不超过四条,分别生成检查代码,再把各组里用到的局部名字统一改写成前面定好的名字,拼接起来。

这份检查方案写成的是一种受限的代码语言,只能用几种固定的操作,比如"判断某个物体是否存在"、"计算某个短语描述的数量是否等于某个数字"、"判断事件A是否发生在事件B之前"、"判断两个物体之间的空间关系"。这份代码在真正开始读视频之前,还要经过一轮静态检查,确认语法没问题、引用的对象都存在、类型匹配、没有循环依赖。检查不通过的部分,会退回去让规划器重写,如果反复几次还是不行,就换成让一个通用的语义判断模型直接看视频回答这个问题,而且这种退让会被明确记录下来,算作一次代价,不会被当成免费的答案。

这套设计带来一个直接的好处:执行阶段,系统只会做规划阶段就已经声明要做的事情。看视频的过程,不会因为某一帧画面特别抓眼球,就临时决定去查一些计划外的东西。所有的测量,最终都能倒查回是哪一条主张、哪一次规划要求它去做的。

三种颜色的判决

有了检查清单,接下来就是真正动手去测量。VeriPhy把这部分工作交给一批各自专精一件事的专用工具,而不是让一个大模型什么都干。

这批工具里最基础的一个是SAM 3,负责在视频里找到提示词提到的物体,并且在整段视频里持续追踪它的位置。有了追踪轨迹之后,系统再用另外十一种专门设计的测量方法,分别计算物体移动了多远、有没有碰到别的东西、形状有没有变化、旋转有没有衰减、是先发生这件事还是先发生那件事,等等。除此之外还有专门读画面深度的模型、专门识别画面文字的OCR工具,以及专门检测声音事件的音频模型。

SAM 3*:一种能够根据文字描述在视频里定位并持续追踪特定物体的分割与追踪模型,是VeriPhy测量运动轨迹的基础。

OCR*:光学字符识别,把画面里出现的文字转换成可供比对的文本字符串。

这里有个细节挺值得琢磨的:测量物体移动的距离时,系统用的单位不是像素,而是物体自身半径的倍数。这样做的好处是不需要知道镜头到底离物体多远,不管画面里的球是占了十个像素还是一百个像素,只要换算成"移动了几个球半径",结果就是可比的。这跟你量身高不用厘米而是说"比我高半个头"是同一个思路,不需要精确刻度,只需要一个跟对象本身绑定的参照系,换算出来的结果反而更稳。

每一次测量都会生成一条带完整来源信息的记录,里面写清楚测量用了哪些帧、用的什么方法、结果是什么。这些记录被分成三种状态:测量成功、放弃测量、或者出错。这里有个容易被忽略却很关键的区分:如果一个物体完整地被追踪到了,但确实没有做出提示词要求的动作,这算一次有效的测量结果,可以据此判定这条主张不成立。但如果是因为物体被遮挡、画面模糊、或者工具本身失灵导致追踪失败,这只能算"放弃测量",绝对不能当成"这个动作没发生"的证据。

这个区分背后是个很朴素的道理:找不到证据,和找到了相反的证据,是两回事。就像你翻遍抽屉没找到钥匙,不代表钥匙一定不存在,可能是你没找的地方还藏着。但如果你亲眼看见钥匙被扔进了垃圾桶,那才是确凿的反证。VeriPhy把这两种情况严格分开,是为了不让工具的失灵,变相变成对视频的一次误判。

每一条主张最后被归结成三种状态里的一种:得到支持、被推翻、或者无法判定。放到整段视频的层面,只要有一条主张被推翻,整段视频就被判定为不合理;如果所有执行过的检查都得到支持,视频被判定为合理;其余情况归为无法判定,也就是弃权不下结论。这种三分类的设计,把"我不知道"当成一个正当的、被允许说出口的答案,而不是强行凑出一个是或非。

时间顺序怎么判断得准

物理事件里有大量涉及先后顺序的主张,比如"多米诺骨牌第一张倒下,引发连锁反应"。这类判断听起来简单,做起来却有陷阱。

论文里给了一个真实的例子。系统需要判断"第一张骨牌向前倒下"这件事,是不是发生在"第一张骨牌触发连锁反应"这件事之前。系统先让语义判断模型确认这两个事件确实都发生了,然后用专门的计时工具分别给这两个事件测出一个时间区间,倒下的动作发生在1.62秒到1.67秒之间,连锁反应发生在2.33秒到7.96秒之间。

这里的关键设计是,系统不会简单地比较两个区间的端点谁大谁小,而是留出一段缓冲余地,这段余地的长度是两个区间里较短那个的四分之一。只有当第一个区间结束的时间,加上这段余地,仍然早于第二个区间开始的时间,系统才会判定"确实是先发生的"。

这个设计避免的问题是什么?如果不留缓冲,只要两个时间区间稍微重叠一点点,系统的判断就会剧烈摇摆,前一秒说A先发生,后一秒因为测量的一点点误差,就变成了B先发生。这就像用体重秤称两袋差不多重的米,秤的精度如果只到十克,你不该在两袋差九克的时候就笃定地说其中一袋更重,得留出一个模糊地带,承认"这俩差不多重,分不出先后"才是诚实的态度。这一整套时序判断逻辑,论文里称之为对经典区间代数的一种带容差的简化版本。

回到判断动作是否发生这件事本身,系统还有一层保护机制:只有当语义判断确认某个事件确实发生了,系统才会让这个事件测出的时间区间进入后续的顺序比较。因为强制要求给出一个时间窗口的定位工具,哪怕这个事件压根没发生,也可能硬凑一个"看起来最像"的时间段出来,这个凑出来的时间段不能被当成事件确实发生过的证据。

物理量到底测了什么

VeriPhy专门用于物理测量的十一种操作,针对的是人类标注者最常抱怨的那几类问题。

论文的统计显示,最常见的抱怨是"提示词要求某个东西动起来,结果它压根没动,或者动的方向反了",比如提示词写着"太阳缓缓升起",视频里的太阳却纹丝不动。针对这类问题,系统专门测量物体的位移,而且取的是运动过程中离起点最远的那个距离,不是最终的净位移,因为如果一个东西先升高又落回原位,净位移会算出零,把真正的运动过程给抹掉了。同时系统会用光流技术把镜头本身的移动去掉,这样即便镜头在跟着物体一起动,测出来的也是物体相对于镜头之外世界的真实位移,不会被镜头运动带偏。

论文里展示的一个具体例子很有代表性:提示词要求"海豚跳出水面",系统测出的海豚垂直方向最大位移只有它自身半径的0.00倍,连一个阈值都没达到,判定这条主张不成立。另一个例子是"水瓶在地板上滚动",系统测出水瓶表面的运动速度和背景的运动速度几乎一模一样,也就是说所谓的滚动,其实是镜头本身在动,瓶子从头到尾就没挪窝。还有一个计数的例子,提示词要求画面里出现三架战斗机,系统实际数出来是四架,直接判定不符。

除了位移之外,系统还测量物体之间的接触距离、表面相对于背景的形变、运动轨迹的形状是圆还是"8"字、物体是否按要求消失或持续存在、旋转物体的转速有没有随时间衰减、镜头运动和物体运动是不是被混淆了,等等。每一种测量,针对的都是一类具体的、容易被笼统的印象打分忽略掉的失败模式。

值得一提的是文字识别这一环。论文里举了个例子,提示词要求横幅上写着"祝贺毕业生",生成的视频里横幅上的文字其实是一串乱码。如果用一个生成式模型去"读"这段文字,它很可能会脑补,把乱码理解成"哦,这应该是想写祝贺毕业生吧",然后就这么报告上去,这样一来真正的错误反而被掩盖了。VeriPhy用的是专门的文字识别工具,只负责如实转录画面上写的是什么,不做任何联想和修正,这样乱码就是乱码,骗不过字符串比对。

这个细节戳中了一个很容易被忽视的道理:让同一个模型既生成答案又判断答案对不对,风险在于它可能会用同一套"脑补"能力去美化检查结果,就像让一个人既当运动员又当裁判,他即便没有恶意,也很容易下意识地把自己的动作往标准姿势上靠拢去理解。

规划过一次的清单,能不能越用越聪明

VeriPhy还有一个值得细说的能力:它能从做错的案例里总结经验,写成人能读懂的文字规则,加到规划器的参考清单里,而且这个过程完全不需要重新训练模型。

具体做法是,每当系统的检查计划漏掉了一条人类标注出来的真实缺陷,就让另一个模型去读这次执行的完整记录和漏掉的内容,总结出一条经验,比如"遇到要求某个数量精确匹配的主张,应该单独设置一个计数检查,并且要在视频的开头、中间、结尾都验证一遍"。这些经验会先被归并,相似的经验合并成一条,最终整理出三十三条,追加进规划器每次都会参考的规则说明里。

论文做了一个对照实验,用一批没有参与总结这些经验的视频来测试,结果显示:没有任何经验加持时,系统能找出502个已知缺陷里的340个,加上这三十三条经验之后,能找出375个,提升了七个百分点。更有意思的是,这个提升几乎是一次性达成的,只用前25个案例总结出来的少量经验,就已经能拿到差不多的提升幅度,后面再用更多案例总结出更多经验,找出的缺陷总数几乎不再增长,只是找出的具体缺陷种类换了换。

这个现象挺耐人寻味的。它说明最早总结出来的那几条经验,可能讲的是某种更通用的道理,比如"看到一个复合的要求,要拆成几个可以分别核实的小点去检查",这条道理适用的范围远远超出它最初被总结出来的那个具体案例类型。就像一个新手厨师第一次学会"先尝一口再放盐"这个习惯之后,这个习惯能用在几乎所有菜里,不需要针对每道菜单独学一遍"先尝一口"这件事。

这种不改动模型参数、只改动一份可读文本的改进方式,论文里称之为一种状态优化,意思是系统真正在学习和积累的,是一份人可以打开、可以读懂、也可以否决的文字记录,而不是深藏在模型权重里、外人完全看不懂的一堆数字。

发现问题之后,能不能自己改

VeriPhy找出问题之后,论文还尝试了让它把发现的问题写成新的提示词,再让视频生成模型重新生成一遍,看看能不能把问题改掉。

这个环节的结果挺诚实的。按照VeriPhy自己的判断标准衡量,这个改进流程效果不错:它只对被判定为有问题的14.8%的视频出手,其中72.4%的视频在改写后确实提升了合理性得分,原本被判定为不合理的视频里有75%被改成了合理,而且几乎没有误伤那些原本就没问题的视频。

但论文没有止步于此,它还找了一个跟VeriPhy完全无关的独立评分模型,对同样这批改写前后的视频重新打分。结果是:这个独立模型几乎没看出任何变化,不管是画面是否符合提示词的语义维度,还是最该改善的物理常识维度,前后的分数都基本持平。

这个矛盾的结果很值得说一说。它意味着一件事:发现问题的模型自己给改进效果打分,和真正独立的第三方给改进效果打分,可能得出完全不同的结论。论文很坦诚地承认,这套实验设计本身没办法分清楚到底是改写确实提升了某种独立评分模型看不出来的物理真实性,还是只是让检查者自己的评分标准变高了,而这两种可能性在现有的实验里是没法区分开的。这也是这篇论文明确留下的一个开放问题,没有藏着掖着,而是老老实实地摆在了论文里。

一段旁支实验:用模拟器控制生成的运动

论文里还有一部分内容,讲的是怎么给视频生成模型一个"确定的物理答案",而不是让它自由发挥。做法是先用物理引擎模拟出一个真实可信的运动轨迹,比如一个球被扔出去、弹起、落地的完整过程,把这个轨迹渲染成一段深度图视频,再把这段深度图作为控制信号,喂给视频生成模型,让它只负责往这个骨架上填充画面细节,不负责决定球到底怎么运动。

这里有个实验挺有意思:研究者尝试在视频生成的中途,把这个控制信号提前撤掉,看模型还会不会继续按照物理引擎给定的轨迹走。结果发现,如果在噪声水平比较高的早期阶段就撤掉控制,球在空中飞行的部分依然会准确复现物理引擎给出的路径,但落地之后的弹跳行为会立刻跑偏,甚至完全反方向。只有当控制信号保留到噪声水平相对更低的阶段撤掉,弹跳这部分才能保留下来。

这说明了一件事:视频生成模型对"物体怎么飞"这件事似乎已经学得比较扎实了,但对"碰撞之后会怎样"这件事,内在的把握要弱得多。这也解释了为什么这套系统坚持要用外部的物理引擎去精确规定运动轨迹,而不是完全信任生成模型自己的判断,因为至少在接触碰撞这个环节,生成模型自己的直觉靠不住。

写在后面

读完这篇论文,最触动我的其实不是那十一种物理测量方法本身,而是那个"规划阶段完全不看视频"的设计选择。

大部分人直觉上会觉得,越早接触到原始数据,判断应该越准。但这篇论文用一种近乎倔强的方式反过来做:先想清楚要查什么,再去看。这背后其实藏着一种对"眼见为实"的警惕,眼睛看到的东西太容易带偏判断了,尤其当画面本身做得足够漂亮的时候。

另一个让我反复琢磨的细节,是那个"找不到证据"和"找到了相反证据"必须严格区分的设计。这其实是个挺普遍的认知陷阱,不只是AI系统会犯,人在很多判断里也容易把"没查到"当成"不存在"。这篇论文把这个区分做成了系统里一条硬性规则,倒是提了个醒。

论文最后坦白的那个开放问题也挺有意思,发现问题的模型给改进效果打分,和独立的第三方打分对不上号。这种诚实的自我怀疑,在一篇论文里其实不算常见,大部分工作宁愿把这类矛盾藏起来,或者干脆不做这个对照实验。

那段乱码的横幅还留在我脑子里,那种"生成模型顺手把错误美化成正确答案"的场景,想想还挺让人心里一沉的,毕竟我们平时依赖AI打分和总结的场合,也未必比这少。

Q&A

Q1:VeriPhy是什么?

A:VeriPhy是一套评估AI生成视频是否符合物理规律的系统,它会先把提示词拆解成一条条可核实的物理主张并写好检查方案,再调用专门的测量工具逐一核实,最终给出带完整证据链的判决,而不是一个笼统的质量分数。

Q2:VeriPhy和普通的问题分解法评估方式有什么区别?

A:问题分解法通常靠向大模型提问来判断,很多问题只能核实物体是否存在这种浅层信息。VeriPhy的规划环节在看视频之前就写好检查方案,执行时调用专门的物理测量工具获取具体数值,每个判断都能倒查到测量证据,准确率也明显更高。

Q3:VeriPhy发现问题后能不能自动把视频改好?

A:论文尝试了把发现的问题写成新提示词重新生成视频,按VeriPhy自己的标准衡量效果不错,但换一个独立的评分模型重新检查,发现物理真实性等维度几乎没有变化,这说明改写是否真正提升了视频质量,目前还是一个没有解决的开放问题。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-