微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 北京大学与英伟达联合出品:当机器人"导演"终于学会了物理常识

北京大学与英伟达联合出品:当机器人"导演"终于学会了物理常识

2026-07-01 08:43
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-01 08:43 科技行者

这项由北京大学与英伟达联合开展的研究,以预印本形式于2026年6月26日发布在arXiv平台,编号为arXiv:2606.28128。研究成果围绕一个名为PhysisForcing的训练框架展开,专门针对机器人操作视频生成中长期以来悬而未决的物理合理性问题提出了系统性解决方案。

假设你正在看一部机器人帮忙叠衣服的宣传视频。画面里,机械臂伸出,夹住了一件T恤——然后,那件衣服忽然凭空穿过了桌子,或者机械臂的"手指"开始像面团一样扭曲变形。你会立刻意识到,这个视频是假的,不是真实的物理世界里会发生的事情。

这个尴尬的问题,正是当前最前沿的视频生成技术(包括那些专门为机器人设计的)每天都在犯的错误。研究团队通过大量实验发现,这类物理上说不通的画面主要来源于两个方面:一是运动物体会发生奇异的形变,二是相互作用的物体之间存在不合逻辑的时空关系,尤其是在接触发生的瞬间。PhysisForcing正是为了系统性地解决这两个顽疾而生的。

一、为什么视频生成模型总是"不懂物理"

在深入了解PhysisForcing之前,有必要理解一件事:为什么那些已经能生成令人叹为观止画面的视频生成模型,偏偏在物理常识上屡屡翻车?

回到拍电影的比喻。一位经验丰富的导演在拍摄一场打斗戏时,不仅要考虑画面好不好看,还要确保演员的动作符合人体力学,道具的反应符合物理规律。现有的大多数视频生成模型,更像是一位只追求"画面漂亮"的摄影师,而不是一位懂得让场景"合理运转"的导演。

通用型视频生成模型(比如Sora、Wan等)在海量互联网视频上训练,学会了渲染逼真的光影、材质和运动,但它们接触到的机器人与物体之间紧密接触、互相作用的视频数据相对稀少,导致它们对这类场景的物理规律"知之甚少"。而那些专门用机器人操作数据进行微调的模型,虽然接触到了更多相关场景,但训练时采用的重建目标往往对所有像素一视同仁——无论是机械臂夹取物体的关键接触区域,还是背景里一动不动的墙壁,模型都同等对待。这就导致了一个根本性问题:模型并不知道哪里才是物理规律最集中体现的"要害"。

此外,一些研究者尝试用几何约束(比如深度信息、关键点追踪、三维结构重建)来弥补这一不足,这类方法能捕捉到局部的运动连贯性,但对"被推开的物体是否真的动了"这类全局性的交互结果却无能为力。还有人尝试用偏好对齐(让模型学习"这个输出比那个更好")来纠正错误,但这类方法是事后补救,而且反馈信号往往稀疏、定位不准。

由此,研究团队提出了一个更本质的问题:能否在视频生成的训练过程中,就引入一套既分层次又聚焦于关键区域的物理监督机制?PhysisForcing的核心思路,正是对这个问题的直接回答。

二、PhysisForcing的核心逻辑:找准"物理要害",分层施压

PhysisForcing的整体思路,可以用一个厨师培训的比喻来理解。普通的厨师培训要求学员把每道菜从头到尾做一遍,但PhysisForcing更像是一位严格的主厨导师,他只在最关键的步骤——比如刀工、火候、调味——旁边盯着,专门纠正这几个决定成败的环节,而不是对每一个搅拌动作都喋喋不休。

具体来说,PhysisForcing的工作分为三个层次:首先找到"物理要害区域",然后分别从像素级别和语义级别对这些区域施加物理监督。

找到物理要害区域的方法,综合利用了两条线索。第一条线索是运动幅度:研究团队使用了一种叫做CoTracker3的点追踪工具,它就像是在视频的每一个像素点上贴了一个隐形的GPS标签,可以追踪每个点在整段视频里的运动轨迹。运动幅度越大的点,越可能处于机器人与物体交互的核心区域。第二条线索是前景深度:研究团队还用了一个叫做Depth-Anything-V2的深度估计工具,从第一帧画面中判断每个点距离摄像机的远近。离摄像机越近、也就是在画面前景的区域,越有可能是机械臂和被操作物体所在的位置,而不是遥远的背景墙壁。

把这两条线索结合起来,每个像素点就有了一个"物理重要性得分"——运动越大、距离越近,得分越高。以全部点的平均得分为门槛,超过门槛的点被标记为物理要害区域,由此形成了一张贯穿整段视频所有帧的"物理蒙版"。这张蒙版,就是后续一切监督的空间依据。

三、像素级别的物理监督:让每一个追踪点都"走得端正"

确定了物理要害区域之后,PhysisForcing的第一层监督聚焦在像素级别,专门解决运动轨迹不连贯的问题。

可以这样理解:一段真实的视频里,机械臂的每一个关节、被抓取物体的每一个角,随着时间推移都会按照物理规律画出一条光滑连贯的轨迹线。如果机械臂的某个点在前一帧还在左边,下一帧忽然跳到了右边,再下一帧又回来了,那这段视频在物理上就是有问题的。

在视频生成的训练过程中,PhysisForcing从视频生成模型(具体来说是DiT,即扩散变换器)的中间层提取特征,把这些特征经过一个轻量级的小网络处理后,转变为可以追踪像素点的"查询特征"。具体做法是:用第一帧的特征作为"查询",用后续每一帧的特征作为"参考",对物理要害区域里的每一个追踪点,通过计算特征之间的相似度来预测这个点在后续每帧里的位置。

这种用特征相似度来预测位置的方式,有点像用人脸识别来追踪一个人——不论他换了衣服、换了背景,只要脸部特征匹配,就能找到他。

然后,将这些预测出来的轨迹与CoTracker3从真实视频里追踪到的参考轨迹进行比较,差距越大,惩罚越重。这个惩罚信号只作用于物理要害区域里的那些点,背景里静止的桌子、墙壁等则不受影响。由此,模型在训练过程中被迫去学习如何让每一个关键点的运动轨迹保持连贯和合理。

四、语义级别的物理监督:让区域之间的"关系"符合常识

仅有轨迹的连贯性还不够。一段机器人视频里,不仅每个点要走得顺,机械臂和被抓物体之间的关系也要对——抓住了就要跟着一起动,放下了就要脱离,不能抓着抓着物体忽然飘走了。这类问题属于全局性的交互关系错误,单靠追踪每个像素点的轨迹无法解决。

PhysisForcing的第二层监督因此聚焦在语义级别,借助了一个完全不同的工具——V-JEPA 2。这是一个由Meta AI研究院开发的自监督视频理解编码器,它不是通过重建像素来学习,而是通过预测视频中被遮挡区域的特征来学习,因此它的内部表示天然地包含了丰富的物体与交互语义信息。可以把V-JEPA 2想象成一位对机器人操作场景有深刻理解的"评论家",它虽然不直接参与生成,但它对每段视频里区域之间应该有什么样的关系心里有数。

在训练过程中,PhysisForcing做了一件很聪明的事:它同时从V-JEPA 2和视频生成模型的中间层分别提取物理要害区域里的特征,然后计算各自的"关系矩阵"——也就是这些区域里的每一对特征之间的相似程度。如果机械臂和被抓物体在V-JEPA 2看来是强相关的(因为它们同步运动,紧密耦合),那么视频生成模型的中间层对同一对区域也应该有相似的判断。

通过让视频生成模型的关系矩阵去"对齐"V-JEPA 2的关系矩阵,PhysisForcing把这位"评论家"对交互关系的理解,悄悄地转移到了视频生成模型的内部表示里。这种对齐只发生在物理要害区域的特征之间,而不是整个画面的所有像素,因此信号更集中、更有效。

这两层监督——像素级的轨迹对齐和语义级的关系对齐——共同构成了PhysisForcing的训练目标,和原本视频生成模型的基础训练损失一起工作。所有这些辅助工具(CoTracker3、Depth-Anything-V2、V-JEPA 2)只在训练阶段使用,一旦训练结束,生成视频时完全不需要它们,因此不会带来任何额外的推理计算开销。

五、应用在哪些模型上,如何训练

为了验证PhysisForcing的通用性,研究团队将这套框架应用到了三个规模和架构都不相同的视频生成模型上:Wan2.2-I2V-A14B、Wan2.2-TI2V-5B和Cosmos3-Nano。

Wan2.2-I2V-A14B是一个采用混合专家架构的大型图像转视频模型,总参数量约270亿,其中每一步只激活约140亿。它的两个"专家"沿扩散时间轴分工:一个负责高噪声阶段,负责确定运动的大方向和全局布局;另一个负责低噪声阶段,负责细化画面的高频细节。PhysisForcing针对这个模型只微调高噪声阶段的专家,因为物理结构(运动轨迹、交互关系)在这个阶段被"写入"视频,是最值得施加物理监督的地方。在训练时,研究团队让高噪声专家处理整个扩散时间轴上的所有时间步,将两套物理损失加到标准流匹配损失上一起训练,而低噪声专家保持原样不动。

Wan2.2-TI2V-5B是一个参数量约50亿的单一文本与图像联合转视频模型,结构相对简单,直接对全部模型参数进行微调。Cosmos3-Nano则是基于Qwen3-VL-8B视觉语言模型构建的混合变换器视频模型,参数量约160亿,研究团队采用了LoRA(一种只微调少量额外参数的高效方法)对其进行训练,并在720p分辨率下进行,每段视频最长支持189帧。

三个模型的训练数据来自同一个经过筛选的机器人操作视频集合,原始数据集RoVid-X包含400万个机器人视频片段,经过严格的运动质量筛选、任务层面去重和字幕对齐过滤后,保留了约50万个高质量片段。两个Wan系列模型均在640×480分辨率、最长81帧的设置下训练20000步,批量大小128,学习率0.00001。

六、三个评测舞台上的实际表现

研究团队在三个权威评测基准上全面检验了PhysisForcing的效果。

第一个舞台是R-Bench,这是一个包含650个图像文本提示对的评测集,从两个维度全面考察生成视频的质量:任务维度(包括操作、空间关系、多实体协作、长时程规划、视觉推理五类)和机体维度(单臂、双臂、四足、人形四类)。R-Bench为每段视频计算五个细粒度子指标,覆盖物理语义合理性、任务执行一致性、机器人主体稳定性、运动流畅度和运动幅度,最终汇总为一个综合得分。

在这个评测上,PhysisForcing对每一个基础模型都带来了明显的提升。以Cosmos3-Nano为例,基础模型的得分是58.4,经过普通微调(不加物理监督)后升至61.5,加上PhysisForcing之后进一步提升至63.8,较基础模型提升了9.2%,较普通微调提升了3.7%。这一得分超越了包括商业产品Wan2.6(60.7)在内的所有对比模型,在整个评测榜单上位居第一。

Wan2.2-I2V-A14B的基础模型得分是50.7,普通微调后升至57.9,PhysisForcing版本(PF-Wan)进一步提升至62.0,较基础模型提升了22.3%,较普通微调提升了7.1%,位居榜单第二。Wan2.2-TI2V-5B的基础版本得分38.0,普通微调后44.8,加上PhysisForcing后升至47.5,涨幅同样可观。

第二个舞台是PAI-Bench的机器人领域评测,包含174个来自真实机器人拍摄场景的图像提示对,由多模态大语言模型作为评委,对每段生成视频的物理和语义合理性进行评分(域得分),同时评估视觉感知质量(质量得分),最终以两者均值作为综合成绩。PhysisForcing同样对两个模型都带来了超越普通微调的提升:Wan2.2-I2V-A14B从79.9提升至81.7,Cosmos3-Nano从84.0提升至85.2,后者再次成为所有参评模型中的最佳,超越了商业产品Wan2.5(81.0)和专门针对物理合理性优化的Abot-PhysWorld(84.9)。

第三个舞台是EZS-Bench,这是一个专门设计来测试泛化能力的零样本评测集。所谓"零样本",意味着评测中的196种机器人形态、场景与任务组合,在训练数据中完全没有出现过——模型没见过这些组合,但仍然需要生成合理的视频。这个评测最能说明PhysisForcing学到的不是死记硬背,而是真正内化了物理规律。在这个最难的评测上,PF-Cosmos同样取得了81.1的最高综合得分,超越Abot-PhysWorld(80.3)和所有其他参评模型。

七、不止于生成视频:帮助机器人真正学会做事

PhysisForcing带来的提升不仅仅停留在视频好不好看的层面,它还被验证为一种对下游机器人决策任务有实际帮助的工具。

研究团队将PhysisForcing训练后的Wan2.2-TI2V-5B接入了一个叫做Fast-WAM的世界动作模型框架。Fast-WAM的工作方式是:先用视频生成模型预测"如果执行这个动作,接下来的视频会是什么样",然后从预测的视频里提取动作信号,最终驱动机器人执行任务。加入PhysisForcing之后,在RoboTwin 2.0六个任务上联合训练的策略,平均成功率从68.2%提升至72.8%。提升最显著的是两个接触密集的任务:"放空杯"(成功率从41.5%跃升至63.0%,提升了21.5个百分点)和"按压订书机"(从49.0%升至60.0%,提升了11个百分点)。这两个任务的共同特点,恰恰是需要精确的机器人与物体接触控制——正是PhysisForcing重点强化的能力。

在另一个叫做WorldArena的封闭循环评测协议下,视频生成模型被当作"世界模拟器"来使用:模型预测未来视频,配合一个逆动力学模型把预测出的未来状态解码为实际动作,然后在RoboTwin 2.0模拟器里执行。加上PhysisForcing之后,Wan2.2-TI2V-5B的平均封闭循环成功率从16.0%提升至24.0%,超越了包括WoW(20.5%)、TesserAct(18.0%)、Genie Envisioner(15.0%)在内的所有参评世界模型规划器。

八、逐层拆解:每个组件到底贡献了多少

研究团队还进行了细致的消融实验,逐一验证每个设计选择的实际价值。

先看两套物理损失各自的贡献。在Wan2.2-TI2V-5B上,以普通微调的44.8分为基准,单独加入像素级轨迹对齐损失可以把分数提升到47.2,单独加入语义级关系对齐损失可以把分数提升到46.2,两者同时使用则达到47.5的最高分。像素级损失的单项提升更大,因为它直接针对的是轨迹不连贯这一最常见的局部错误;语义级损失的提升略小,但它修复的是接触破裂这类全局关系错误,与前者错误模式不同,因此两者叠加能产生互补效果。在更大的Wan2.2-I2V-A14B上,这一规律同样成立(57.9→62.0),说明这种互补性并不依赖于特定的模型规模。

再看物理区域聚焦的价值。如果把同样两套损失施加在视频的全部像素和所有特征上而不加区分,得分从44.8提升到46.0;但只在物理要害区域施加损失,得分进一步提升到47.5。这说明背景里那些静止的区域确实会稀释物理信号,让模型分不清哪里的梯度才是真正重要的——专注于关键区域,才能让物理监督真正发挥作用。

还有一个关于"在哪一层DiT特征上施加监督"的实验。研究团队在Wan2.2-TI2V-5B上测试了第10、15、20、25层,结果第15层(中间层)表现最佳,在PAI-Bench机器人领域得到了85.2分,而第10层(偏浅)为83.9分,第25层(偏深)为83.2分。偏浅的层还主要承载表面外观特征,语义结构尚未形成;偏深的层已经高度专注于噪声预测的最终输出,难以通过额外监督加以引导;中间层恰好在两者之间,既包含丰富的运动和结构信息,又还未过于专门化,是施加物理监督的最佳位置,而且在附近几层之间效果都比较稳定。

九、视觉上的差异:一眼就能看出来

量化数字之外,研究团队还展示了大量对比案例,直观呈现PhysisForcing改善视觉结果的效果。

在一段"把红苹果移到木质平台第二层"的提示下,Wan2.6生成的视频里苹果出现了不自然的形变,Seedance 1.5 Pro版本里苹果的移动轨迹不连贯,Veo 3.1里机械臂与苹果之间的接触时常出现穿透,Cosmos3-Super里机器人的肢体出现了形态变形,而Abot-PhysWorld生成的结果在接触关系上也存在不一致。PhysisForcing(PF-Cosmos)的输出则保持了苹果形态稳定、机械臂运动连贯、接触和放置动作符合物理常识的整体质量。

类似的改善在"从地上捡起蓝色衣物放入洗衣篮"、"从桌上捡起有孔的面包"、"从传送带上捡起棕色盒子"、"双臂合作把笔帽套回笔上"、"打开米色储物箱"等多个不同场景和任务类型中都有所体现。在人形机器人任务(如捡起面包放入烤箱、人形机器人搬运酒杯)和双臂协作任务中,PhysisForcing同样表现出更稳定的物理一致性。

从基础版本微调与PhysisForcing版本的对比来看,在Wan2.2-I2V-A14B上,普通微调版本常常在操作过程中让被抓物体变形或丢失接触,而PF-Wan保持了物体形态稳定并生成了连贯的抓取放置轨迹。在Cosmos3-Nano上,同样的对比展示了PF-Cosmos在接触动态和物体间关系维持上的明显优势,涵盖单臂、双臂和人形机器人任务。

说到底,PhysisForcing做了一件看起来简单但需要系统设计才能实现的事:它告诉视频生成模型,生成一段机器人操作视频,不是把画面渲染得漂亮就够了,机械臂在哪里、物体怎么动、它们之间的关系如何演变,这些都是有真实物理规律约束的,你必须把这些规律学进去。

这对普通人意味着什么?如果未来机器人要真正走进家庭、走进工厂,辅助人们完成各种操作任务,那么训练这些机器人的方式之一就是让它们在虚拟世界里"看"大量的操作视频,从中学习动作和技能。但如果这些视频在物理上是胡说八道的,机器人学到的也只会是胡说八道。PhysisForcing通过让视频生成模型真正理解物理规律,为构建更可靠的机器人训练素材迈出了重要一步。

当然,PhysisForcing本身也有其局限性。它是一套微调方案,最终效果的上限取决于它所依赖的基础视频生成模型的能力——目前开源模型在长时程推理和对世界的深层理解上仍有明显欠缺,这是任何微调方法都无法突破的天花板。研究团队相信,随着更强大的基础模型的出现,PhysisForcing的物理约束方案因其与模型架构无关的特性,将能与更强的底座形成叠加效应,带来更大的提升空间。

有兴趣深入了解这项研究全貌的读者,可以通过arXiv编号2606.28128查阅完整论文,其中包含详尽的实现细节、评测基准说明、消融实验数据以及丰富的定性对比案例。

Q&A

Q1:PhysisForcing框架是如何确定视频中哪些区域最重要的?

A:PhysisForcing结合了两条线索来找"物理要害区域":一是用CoTracker3追踪每个像素点的运动幅度,运动越大说明越可能是机械臂或被操作物体所在位置;二是用Depth-Anything-V2估计第一帧的深度,离摄像机越近的前景区域越可能是交互发生的地方。把两条线索相乘得到一个综合评分,超过平均分的区域就被标记为物理要害区域,后续的所有物理监督都聚焦在这些区域上。

Q2:PhysisForcing在实际机器人任务中能提升多少成功率?

A:在RoboTwin 2.0六个任务上,加入PhysisForcing后策略平均成功率从68.2%提升至72.8%。提升最大的是接触密集型任务,比如"放空杯"从41.5%升至63.0%,"按压订书机"从49.0%升至60.0%。在WorldArena封闭循环评测中,作为世界模型规划器的成功率从16.0%提升至24.0%,超越了所有参评的世界模型基线。

Q3:PhysisForcing用的辅助工具在生成视频时也需要运行吗?

A:不需要。CoTracker3、Depth-Anything-V2和V-JEPA 2这三个辅助工具只在训练阶段使用,专门用来生成物理监督信号。一旦训练结束,这些工具全部丢弃,生成新视频时完全不需要运行它们,因此PhysisForcing不会增加任何推理阶段的计算开销。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-