微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 视频扩散模型为什么总是违反物理规律?答案藏在注意力机制的一个隐藏缺陷里

视频扩散模型为什么总是违反物理规律?答案藏在注意力机制的一个隐藏缺陷里

2026-10-05 14:59
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-10-05 14:59 • 科技行者

你有没有刷到过这样的AI生成视频:一个篮球从空中落下,本该弹起几次然后慢慢停下,结果它却诡异地悬停在半空中,或者突然消失又出现在另一个位置。

这不是个例。北京邮电大学的研究团队用Wan2.1这款主流的文本生成视频模型做了大量测试,发现同样一句话“一个篮球从半空垂直落下,撞到木地板上弹起几次”,换不同的随机种子生成视频,四次里有三次都会出现违反物理规律的诡异现象:篮球中途悬空、反重力漂浮,或者突然静止不动。

这事儿挺让人困惑的。现在的视频生成模型在画面美感、动作流畅度、听懂指令这些方面已经做得相当不错了,可为什么连最基本的“东西掉下去会往下落”这种常识都保证不了?

过去解决这个问题的思路,基本都是往模型外面加东西:找个物理引擎当参谋、用大语言模型把提示词写得更详细、或者专门收集一批物理现象丰富的视频来训练。这些办法或多或少都管用,但有个共同的毛病,就是没有真正搞清楚问题出在哪儿,只是在外面打补丁。

这篇论文换了个思路。它决定钻进模型内部,看看视频生成的每一步到底发生了什么,尤其是负责“决定物体该往哪儿运动”的那个环节,论文管这个环节叫“运动规划”。

运动规划到底在哪一步发生

想弄清楚运动规划怎么运作,先得知道视频扩散模型是怎么工作的。

**扩散模型*:一种通过逐步去除噪声来生成内容的AI技术。它先从一堆随机噪声开始,然后一步步“猜”出真实图像或视频应该是什么样子,每一步都让结果更清晰一点,最终从满屏雪花点变成一段完整的视频。

以Wan2.1-T2V-1.3B这个模型为例,它生成一段视频要经过50步去噪。研究者们观察到一个很有意思的现象:视频里物体的形状和运动轨迹,其实在前5步就基本定下来了,后面45步主要是在填充细节,比如纹理、光影这些。

这个发现本身不算新,之前已经有研究提到过“先定形状,后补细节”这个规律。但没人说清楚,这个形状到底是怎么在这前5步里“定”下来的,模型内部具体做了什么操作。

论文的团队盯上了两个模块:交叉注意力和自注意力。

**交叉注意力*:视频生成模型里负责把文字提示的语义信息,比如“篮球”这个词代表的含义,分配到视频画面不同位置的机制。可以理解成一个“翻译官”,把“篮球”这个抽象概念翻译成画面上某块区域该显示什么内容。

研究者们把交叉注意力从视频画面(专业说法叫“视频潜在表示”)到“篮球”这个词的注意力强度画成了热力图,逐帧逐步骤地看。结果发现,在去噪的第1步,篮球的位置完全是噪声,杂乱无章;到第3步,画面上开始冒出好几个高亮的候选区域,分布在可能的运动轨迹上;到第5步,这些候选区域开始收敛聚拢;到第7步,一条清晰的运动轨迹就已经浮现出来了。

这就好比你让一群人猜一个球从哪儿扔到哪儿,一开始大家七嘴八舌各有各的猜测,画面上到处都是可能的落点,随着讨论深入,大家的意见逐渐趋同,最后所有人都指向同一条弹跳路线。如果这个收敛过程被打断或者引导错了方向,那么最终的“共识”就会是错的,篮球就会诡异地悬在空中。

不是所有的注意力头都在“想”同一件事

Transformer模型里有个概念叫“注意力头”,一层网络里会有很多个头并行工作,每个头可能专注于不同的信息。Wan2.1-T2V-1.3B每层有12个头,一共30层。

研究者们本来猜想,越是清晰地表现出运动轨迹的头,对运动规划的贡献应该越大。但事实给了他们一记意外的耳光。

为了验证这个猜想,他们设计了两个指标。一个叫“收敛速度”,衡量一个头的注意力模式多快聚拢到最终轨迹上;另一个叫“头贡献度”,用一种叫因果干预的方法,把某个头的输出人为清零,看看视频生成结果会不会受影响,受影响多大。

**因果干预*:一种检验某个模块是否重要的实验方法,做法是故意屏蔽或修改这个模块的输出,再对比屏蔽前后结果的差异,差异越大说明这个模块越关键。

结果分成了四类头。第一类和第二类头,虽然它们的注意力贡献分数(用一种叫“归因贴片法”的技术估算出来)看起来还挺高,但它们的注意力图案压根没显示出清晰的运动轨迹,画面乱糟糟的,或者高亮区域根本不在物体上。研究者把这类头统统屏蔽掉之后,发现篮球的运动轨迹居然完全没变化,只是物体的外观大小有点变化。这说明这些头管的是“篮球长什么样”“背景是什么”这类静态内容,跟运动规划没关系。

第三类头数量很少,但一旦被屏蔽,篮球的运动轨迹立刻崩溃,变得杂乱无章。这类头才是真正驱动运动规划的核心。

第四类头虽然也表现出清晰的轨迹图案,但屏蔽掉之后,只是篮球的初始位置稍微偏移了一点,整体轨迹没有大的变化。

这个发现很关键:一个头表现出清晰的轨迹图案,不代表它就是决定运动的头。 就好比一个会议室里,有人一直在认真记笔记,笔记记得又快又准,但真正拍板做决定的可能是坐在角落一直没说话的那个人。表面的活跃度和实际的决定权,完全是两码事。

自注意力:真正决定“选哪个位置”的幕后推手

交叉注意力负责把语义分配下去,但它没法决定物体具体该出现在画面哪个精确位置上。真正协调这件事的,是自注意力模块。

**自注意力*:让视频里不同帧、不同位置的信息互相“对话”交流的机制,正是靠它,模型才能保证第10帧的篮球位置和第11帧的篮球位置能对上,形成连贯的动作。

研究者观察发现,在去噪早期,同一帧画面里往往会同时存在好几个“候选区域”,也就是篮球可能出现的几个不同位置。这些候选区域之间要经历一场竞争,最后胜出的那个才会成为最终定格的位置。

问题来了:这场竞争是怎么进行的?谁会赢?

研究团队设计了一套指标体系来量化这场竞争,其中最核心的叫“互一致性”,衡量两个候选区域之间互相关注、互相认可的程度。数值越高,说明这两个区域之间的“默契”越强,越可能最终胜出。

通过对失败案例(篮球在空中悬停不动)的逐帧分析,他们发现了一个惊人的规律:在去噪第2步,14帧里有个候选区域K1,因为跟第10帧一个已经率先“站稳脚跟”的区域位置很接近,互一致性得分很高,看起来它要赢了。但到第3步,另一个候选区域K3反而后来居上,把K1挤了下去,原因也是因为K3恰好跟第10帧那个已经站稳的区域位置更接近。

这个现象背后的元凶,是一种叫做RoPE的位置编码技术。

**RoPE*:全称旋转位置编码,是Transformer模型里给不同位置的token(可以理解为画面的一个个小方块)标注“坐标”的方法,让模型知道谁离谁近、谁离谁远。

RoPE有个特性叫“长程衰减”,简单说就是距离越远,两个位置之间的注意力强度就越弱。这本来是个合理的设计,毕竟距离远的东西关联性通常也弱。但问题在于,这个衰减机制在空间维度上(也就是画面的高和宽方向)表现得太强势了,导致同一个空间位置,即使在不同帧里,也会因为“空间距离近”而互相强烈吸引注意力,哪怕这样做在物理上根本说不通。

研究者管这个现象叫“空间锚定效应”。打个比方,这就像一群人在不同房间里投票选代表,投票规则本该看候选人的能力和政见,结果实际执行下来变成了“谁离我近,我就投谁”,跟隔壁房间同一个座位号的人产生了莫名其妙的默契,完全忽略了候选人本身是不是真的靠谱。这样一来,一旦某个位置因为空间上凑巧“抱团”而获得了早期优势,哪怕这个位置在物理上根本不合理,也可能压过其他更合理但离得稍远的候选区域,最终导致生成的视频里物体做出违反重力和惯性的诡异动作。

论文里给出了具体证据:早期候选区域之间的竞争是极其不稳定的,胜负差距经常在零附近来回摇摆,这说明这个阶段模型其实处于一种“信心不足”的敏感状态,一点点空间锚定带来的偏向,就足以左右最终结果。

给RoPE动一次小手术

既然病灶找到了,接下来就是开药方。

论文提出的方案听起来出奇地简单:把RoPE在空间维度(高和宽方向)上的衰减速度调慢一点。

具体做法是引入两个小于1的缩放因子,分别作用在高度和宽度方向的旋转角度上。数学上讲,就是把原来的旋转角度乘上一个小于1的系数,这样两个位置之间即使距离较远,衰减也不会那么剧烈,给模型留出更多“探索”不同候选区域的空间。

这个思路的逻辑是:既然过强的空间衰减导致模型过早锁死在某个位置,不给其他更合理的候选区域喘息的机会,那么放松这个衰减,就相当于给竞争多留一点时间和空间,让真正合理的候选区域有机会翻盘。

这就像一场比赛的评委打分规则本来是“离终点越近的选手,加分越多”,结果这个加分幅度设得太夸张,导致选手们还没跑完全程,名次就已经因为起跑位置的微小差异而提前锁定,后面的努力全都白费。如果把这个加分幅度调低一些,选手们就有更多机会凭真实表现逆转局势,而不是被起跑线的位置差距过早决定命运。如果不做这个调整,会怎样呢?论文里的实验数据给出了答案,那些悬空、漂浮、静止的失败案例会反复出现,因为模型压根没有机会去纠正早期的错误判断。

不过实践中研究者发现,光靠推理阶段临时调整这个缩放系数(不需要重新训练模型),效果虽然有改善,但很不稳定,每个视频、每个随机种子都得手动调参数才能达到最佳效果,没法批量应用。于是他们又设计了一套训练方案:让模型在训练阶段就学会适应这种调整过的RoPE,同时设计了一个专门的时间步采样器,让训练更集中在去噪的早期阶段(因为这才是运动规划真正发生的地方)。

值得一提的是,研究者还试过让模型自己学习每个注意力头该用多大的缩放系数,结果是灾难性的,大约一半的头往一个方向调,另一半往相反方向调,整体没有明显改善。这从侧面印证了一个更深的问题:运动信息在整个视频画面信息里占的比例太小了,模型的训练信号(损失函数)主要被那些占大头的静态信息主导,很难专门针对运动这个“小角色”做精细调整。这也是为什么必须靠强制手段(固定缩放系数、专门的采样策略),而不能指望模型自己“想明白”。

实验结果:数字说话

研究团队在VideoPhy这个专门评测物理常识的基准测试上做了系统验证,这个测试集包含343个案例,涵盖固体对固体、固体对流体、流体对流体三种材质互动场景。

评测用了两个指标,一个是语义遵循度(SA,衡量视频有没有按照提示词生成),一个是物理常识度(PC,衡量视频里的运动是否符合物理规律)。

基础模型Wan2.1-T2V-1.3B在两项指标上分别是53.64%和29.45%,可以说物理常识这一项,还不到三成的及格线。加上论文提出的RoPE修改并配合模型微调之后,两项指标提升到64.72%和41.98%,如果再叠加提示词优化,更是冲到了87.46%和62.68%,物理常识这一项相当于翻了一倍还多。

对比其他方案也很能说明问题。用普通的LoRA微调,PC只能做到35.57%;引入外部视频基础模型做指导的VideoREPA方法,PC做到37.90%;而这篇论文的方法在没有借助任何外部模型的情况下,单靠调整一个缩放系数,PC就做到了39.94%,训练之后更是达到41.98%。

有意思的是,改进效果在“固体类”场景里特别明显,因为固体的运动幅度通常比流体(水、烟雾这类)更大,而这正好是空间锚定效应影响最严重的地方。反过来在流体对流体的场景里,改进就不那么突出,这倒是从另一个角度印证了研究者对问题根源的判断是准的。

另外还有个额外发现:在LoRA微调时,如果只调整注意力模块的参数,效果最好,且不会损伤画面美感;一旦把前馈网络(FFN)也拉进来一起训练,虽然运动没什么改善,画面质量反而变差了,比如瓶塞的形状会扭曲变形。这进一步说明,物理常识的问题确实出在注意力机制上,而不是负责处理静态外观的FFN模块,这也让整篇论文的逻辑闭环了。

写在后面

读完这篇论文,最让我意外的一点是,研究者并没有把物理常识问题简单归结为“数据不够”或者“模型不够大”,反而发现更大的14B模型在物理表现上并不比1.3B的小模型更好。这说明单纯堆参数、堆数据,可能压根解决不了这个问题,因为问题不在容量,而在结构性的机制缺陷。

另一个让我反复琢磨的细节是那个“可学习缩放系数”实验的失败。研究者原本以为让模型自己学习调整RoPE的松紧程度会是更优雅的方案,结果却是一半头往左调一半头往右调,相互抵消,什么都没改善。这个失败案例其实比成功案例更有启发性,它暴露了一个更深的问题:当某个信号(比如物体运动)在总体训练信号里占比太小的时候,靠端到端的梯度下降去"自然涌现"出对这个信号的精细处理,可能根本不现实,有时候就是需要人为地、"粗暴"地把训练的注意力摁到该在的地方。

这也让人想到一个更大的问题:视频生成模型现在被寄予"世界模拟器"的厚望,但这篇论文揭示的现象说明,模型内部处理"运动"和处理"外观"用的是完全不同的机制,而且这两套机制之间存在某种此消彷长的张力。如果未来想让视频模型真正理解物理规律,是不是需要专门给"运动"这件事开辟一条独立的信息通道,而不是任由它在海量像素信息里自生自灭?

篮球该往下落还是该悬在半空,决定权也许从来不在我们熟悉的"重力常识"里,而在一串旋转角度的衰减速率里。这事儿细想起来,还挺让人后背发凉的。

Q&A

Q1:视频扩散模型为什么会生成违反物理规律的内容?

A:研究发现问题出在自注意力机制里的RoPE位置编码上,它的空间衰减效应过强,导致早期候选位置因为空间上离得近而提前锁定,压制了其他更符合物理规律但距离稍远的候选轨迹,最终导致悬空、漂浮等失败现象。

Q2:论文提出的RoPE修改方法效果如何?

A:在VideoPhy基准测试上,基础模型物理常识得分只有29.45%,经过RoPE修改加训练加提示词优化后提升到62.68%,尤其在固体类大幅度运动场景中改进最明显。

Q3:为什么模型内部的运动规划集中在去噪的前几步?

A:研究通过交叉注意力可视化发现,物体的运动轨迹在50步去噪过程的前5步就基本确定,后续步骤主要用于填充纹理等细节,这符合此前学界发现的“先定形状后补细节”规律。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-