微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 东北大学联合佐治亚大学等机构:让机器人"快想快动",一步到位的世界动作模型加速新方案

东北大学联合佐治亚大学等机构:让机器人"快想快动",一步到位的世界动作模型加速新方案

2026-06-11 09:04
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-11 09:04 科技行者

这项由东北大学、佐治亚大学和EmbodyX公司联合完成的研究,以预印本形式于2026年6月发布在arXiv平台,论文编号为arXiv:2606.05254。研究团队提出了名为Flash-WAM的全新框架,专为让机器人策略模型从"慢思考"升级为"快反应"而生。

**一、机器人的"想象力"为何让它慢如蜗牛**

现代机器人要完成一项任务,比如从桌上拿起一个瓶子,背后其实需要经历一个复杂的"脑内推演"过程。它要先在脑海里"播放"一段未来几秒钟的画面——手会怎么移动、瓶子会怎么倾斜、手指在哪里合拢——然后再把这段"想象视频"翻译成一系列精确的关节动作指令。这种先"脑补画面"再"下达动作"的工作方式,正是当前最前沿的一类机器人控制技术,研究者称之为"世界动作模型"(World Action Model,简称WAM)。

WAM的核心优势在于,它继承了海量视频数据训练出的"空间感"和"物理直觉",因此对真实世界的理解比单纯看图预测动作的模型要深得多。然而,这种脑补过程代价高昂。以当前最先进的开源世界动作模型LingBot-VA为例,每次"脑补"一个动作片段需要完成25步视频推演加上50步动作推演,两个过程合计在单块NVIDIA L40S显卡上消耗约8.1秒。对于需要实时响应的机器人控制来说,8秒才能想好下一步怎么做,无疑是灾难性的延迟。

把这个问题放到日常生活里理解就更直观了。打乒乓球的运动员需要在零点几秒内判断球的落点并做出回击,如果每次判断都要耗费8秒,比赛根本无从进行。机器人在工厂流水线或家庭辅助场景中面临的也是同类挑战。正因如此,研究团队把目标锁定在如何大幅压缩这个"脑补"过程,同时不让机器人的任务表现打折扣。

**二、现有"提速药方"为何在这里失灵**

在图像和视频生成领域,研究者已经发展出一套成熟的"提速"技术,叫做步骤蒸馏(step distillation)。这类技术的核心思路是:让一个"慢而准"的老师模型,把自己的精华知识浓缩传授给一个"快而省"的学生模型,从而让学生用一两步就能达到老师几十步才能达到的效果。

这个过程可以用"速成厨师培训"来理解。一位经验丰富的主厨做一道菜需要精心调味、反复品尝、多次调整,整个过程花费一小时。而经过特殊培训的速成厨师,通过提前掌握主厨的"精髓判断标准",可以在五分钟内做出质量相近的菜品。步骤蒸馏就是把"主厨的精髓"提炼并传授的过程。

其中一种叫做"一致性蒸馏"(Consistency Distillation)的方法尤为受欢迎,因为它不需要额外的辅助网络,与主流的"流匹配"生成框架(flow matching)天然契合,理论也最为清晰。然而,当研究团队把这套方法直接套用到WAM上时,任务成功率从91%以上直接崩溃到23%左右。从"几乎全部搞定"到"大多数失败",这不是小幅度的性能损耗,而是彻底失效。

研究团队面对这个结果没有简单地调调参数了事,而是深入追问:这套方法为什么在这里失灵?

**三、发现问题根源:视频和动作生活在完全不同的"噪声世界"**

要理解根本原因,需要先了解WAM的一个关键设计细节。WAM同时生成两类信号:视频帧(画面)和动作序列(关节指令)。这两类信号的"体型"和"精度需求"天差地别。视频是高维度的、视觉上有大量冗余信息的信号,就算画面稍微模糊一点,机器人依然知道"那是一个瓶子"。而动作序列是低维度、高精度的信号,关节角度差了一点点,可能就导致机器人抓空了。

为了匹配这两类信号的不同特性,WAM在训练时给它们配备了不同的"噪声计划"(SNR-shifted noise schedule)。视频流使用高SNR偏移的噪声计划,这意味着训练时视频更多处于高噪声状态(画面很模糊);动作流使用更均匀分布的噪声计划,噪声从低到高都有大量训练样本。

用一个类比来说:视频的训练像是在学习"从厚厚的雪中看清一张脸",而动作的训练像是在学习"在从完全清晰到轻微模糊的各种状态下精确测量一把尺子的刻度"。

现在,一致性蒸馏方法的关键机制是通过一个叫做"一致性函数"的工具向学生模型传递学习信号。这个函数包含一个叫做b(σ)的成分,σ代表当前噪声水平。学生模型在某个噪声水平σ下能够接收到多强的学习信号,与|b(σ)|的大小成正比——这个值越大,模型学到的东西越多;越小,模型几乎学不到任何东西。

标准的LCM一致性蒸馏方法(Latent Consistency Model)使用的b函数有一个关键特性:当σ趋近于0时(即低噪声状态),|b(σ)|以σ?的速度趋近于零,也就是"平方级别的消失"。当σ=0.1时,这个学习信号强度比高噪声区域小了约36倍。

对视频流来说,这不是大问题,因为视频主要在高噪声区域训练,那里b函数还挺大的。但对动作流来说,它大量的训练样本恰好分布在低噪声区域,而在那里,LCM的学习信号几乎为零。结果是:视频还在认真学习,动作基本上没有收到任何有效的教学信号,自然就"崩了"。这不是参数没调好,而是方法本身在这个场景下存在结构性缺陷。

研究团队将这一发现提炼为一个数学命题(Proposition 1),严格证明了:任何满足边界条件的一致性函数,其b(σ)在σ趋近于0时最好能以线性速度(即σ)趋近于零,而不是以平方速度(σ?)消失。LCM恰好落在这个"次优"区间,而且无论怎么调整LCM的参数σ_d,都无法突破这个限制,因为对任意σ_d都有σ?σ_d/√(σ?+σ_d?) ≤ σ这个不等式成立。换句话说,LCM家族的任何成员都达不到最优梯度缩放,这是结构性的,不是参数性的。

**四、Flash-WAM的核心方案:给不同的流量选不同的管道**

既然问题出在"一个尺寸强行套两种场景",解决方案自然是"因材施教"——为视频流和动作流分别选择最适合它们的一致性函数。

动作流需要的是一个在低噪声区域提供充足学习信号的函数。根据前面的理论分析,只要b函数在σ=0处的导数不等于零(即b'(0)≠0),就能实现线性级别的梯度缩放,达到理论最优。最简洁、不含任何额外超参数的满足这一条件的选择是:a(σ)=1,b(σ)=-σ。对应的动作流一致性函数就是将x_σ减去σ乘以速度预测,即f_a = x_σ - σ·v_θ(x_σ, σ)。这个公式看起来极其简单,但它的重要性在于:b(σ)=σ在整个[0,1]区间都保持线性,不会在低噪声区域消失,动作模型从头到尾都能接收到有效的学习信号。

视频流的情况则不同。视频的训练质量主要集中在高噪声区域,LCM在那里本来就提供足够的学习信号。因此,视频流的选择标准不是"在低噪声区提供信号",而是"在高噪声区保持稳定"。LCM所使用的Karras参数化(来自扩散模型设计领域的经典工作)在这方面有两个具体优势:其一是"方差保持",即无论噪声水平如何,函数输出的方差都稳定在σ_d?附近,不会随噪声水平剧烈波动;其二是"有界输出范围",在高噪声时c_out趋近于σ_d,限制了输出幅度,防止训练早期模型漂移出数据分布。而如果对视频流也强行使用动作流的简单线性参数化,则在高噪声下预测误差会被放大σ倍,带来数值不稳定风险。因此,视频流沿用LCM参数化:f_v = c_skip(σ)·x_σ + c_out(σ)·x_0。

把两个流合并训练时,损失函数由视频损失和动作损失加权求和组成,具体是L = L_v + λ_a · L_a,其中λ_a是动作损失的权重系数。两个一致性目标通过单次模型前向传播同时计算,视频和动作的token拼接成联合序列输入到共享的transformer骨干网络,因此推理时的计算成本与原始模型完全相同,只在损失计算头上有所不同。

**五、实验验证:数字说话**

研究团队将Flash-WAM应用于LingBot-VA(一个在双臂操作任务上表现领先的开源世界动作模型),在两个模拟基准测试和一个真实机器人平台上进行了系统验证。

在RoboTwin 2.0基准测试上(涵盖50个双臂操作任务,分"固定初始状态"和"随机化初始状态"两个版本),原始LingBot-VA以25步视频加50步动作的配置达到91.25%的平均成功率。使用Flash-WAM蒸馏到1步视频加2步动作后,成功率为85.54%,代价是约6个百分点的性能损失,但换来了19倍的速度提升。进一步压缩到1步视频加1步动作(即23.3倍加速),成功率仍保持在81.41%,每个动作片段的推理延迟从8.1秒降至348毫秒,低于研究团队设定的500毫秒实时控制预算。

对比之下,其他方法的表现则差强人意。直接把标准LCM套用到视频和动作两个流(朴素联合LCM),在1步视频加2步动作配置下成功率仅有23.97%,几乎完全失效,在任务难度较高的"3步连续操作"子集上成功率接近零。基于分布匹配蒸馏的DMD2方法需要额外的评论网络和对抗训练,在相同配置下达到78.74%,但实现复杂度远高于Flash-WAM。只蒸馏视频流、保留原始动作步数的"仅视频LCM"在1步视频加2步动作配置下达到78.79%,而在1步视频加1步动作时进一步下滑到73.68%。Flash-WAM在所有配置下均明显领先。

在LIBERO基准测试(包含空间理解、物体操作、目标达成和长时域四个子集)上,Flash-WAM以1步视频加2步动作配置达到95.7%的平均成功率,接近原始模型的98.6%,速度提升13.7倍;1步视频加1步动作配置下为95.1%,速度提升16.3倍,将每片段推理延迟从6767毫秒压缩到404毫秒。

真实机器人实验在宇树G1人形机器人上进行,覆盖三个任务:揭开锅盖并把土豆放进锅里、从混有干扰物的场景中拾取红色瓶子、拾取粉色物体并放置到目标位置。原始LingBot-VA以3步视频加10步动作运行,平均成功率66.7%。如果不做任何蒸馏直接把步数减少到1步视频加2步动作,成功率崩溃到40%。仅蒸馏视频流的方法在相同配置下恢复到43.3%。Flash-WAM则达到60%,在最难的"揭锅盖放土豆"任务上,从裸减步数的30%恢复到50%,在1步视频加1步动作更激进配置下也保持50%的整体成功率。

研究团队还对视频预测质量做了定性对比,通过开环自回归生成(即模型完全依靠自己的预测滚动生成后续片段,不接受真实观测反馈)来检验视频生成质量。原始模型生成的画面清晰,物体轮廓和机器人手型全程保持。朴素联合LCM下棕色瓶子在后续帧中直接消失,橙色瓶子变得极度模糊;DMD2下橙色瓶子同样消失。Flash-WAM的视频在整个滚动过程中场景结构和物体身份都保持可辨认状态。

**六、消融实验:每个设计决策都经过检验**

为了确认Flash-WAM中每个设计选择的必要性,研究团队系统地比较了四种策略。

朴素联合LCM(视频和动作同用LCM参数化)的失败已经充分说明,在低噪声区域的梯度消失是结构性问题,不可忽视。仅视频LCM(只蒸馏视频、保留动作完整步数)避免了崩溃,但在1步视频加2步动作配置下仍比Flash-WAM落后约7个百分点,说明动作流的蒸馏本身是不可省略的。

研究团队还测试了一种"折中"方案:只蒸馏视频流,同时对动作流加入MSE正则化损失(视频LCM+正则化)。在1步视频加2步动作配置下,这个方案比纯视频LCM提高了约6个百分点,但在更激进的1步视频加1步动作配置下,反而比纯视频LCM低了24个百分点。这说明当动作步数预算极度紧张时,外加辅助损失无法替代真正的动作流一致性蒸馏,甚至会产生反效果。Flash-WAM的模态感知参数化是唯一在所有配置和所有任务难度层级上都保持稳定性能的策略。

在附录中,研究团队还报告了完全联合版的DMD2(同时对视频和动作做分布匹配蒸馏,不加正则化),在1步视频加1步动作配置下仅达到52.7%,远低于Flash-WAM的82.56%,进一步印证了"不加区分地对两个流使用相同蒸馏策略"这一思路的根本局限。

**七、这一切对机器人技术意味着什么**

把所有信息串联起来,可以看到这项研究完成了一件很有意义的事:它找到了一个之前被忽视的关键不匹配,并用一个理论上有据可查、实践上有效的方案解决了它,而且解决方案本身实现简单,不需要额外的网络或复杂的训练流程。

从实用角度看,Flash-WAM让世界动作模型从"实验室里的慢动作展示"变成了"现实场景中的实时控制"。348毫秒的单片段延迟意味着机器人可以每秒约三次更新自己的动作计划,这对许多实际操作任务已经足够流畅。同时,60%的真实机器人成功率虽然还不能覆盖所有失败情形,但相比裸减步数的23%和单纯视频蒸馏的43%,已经是实质性的进步。

研究团队也坦诚地列出了当前的局限。Flash-WAM目前只在单一共享骨干网络架构的WAM上验证,对于采用多个独立子模型的架构(如Motus的混合专家变换器结构)如何迁移还需要进一步工作。论文中的分析只聚焦于低噪声区域的梯度缩放最优性,对高噪声区域的完整理论刻画还留有空间。此外,模态感知选择原则是否能推广到分布匹配蒸馏方法或其他多模态扩散系统,同样值得深入探索。

归根结底,这项研究最有价值的地方不仅仅是给出了一个有效的方案,而是清晰地揭示了"为什么简单套用不行"——这个诊断本身为后来者指明了方向。当两种信号在不同的噪声世界里生活时,任何试图用同一把钥匙打开两把锁的做法,都需要事先问清楚这两把锁是不是同一规格的。Flash-WAM的答案是:它们不是,必须分别配钥匙。

有兴趣深入了解技术细节的读者,可以通过arXiv编号2606.05254查询完整论文,项目主页为flashwam.github.io,包含更多可视化演示材料。

---

Q&A

Q1:Flash-WAM和普通的一致性蒸馏方法(LCM)有什么本质区别?

A:普通LCM对视频和动作流使用同一套参数化,但这两种信号的噪声分布差异很大——动作流大量训练样本集中在低噪声区,而LCM的学习信号在低噪声区会以平方速度消失,导致动作几乎学不到东西。Flash-WAM的核心区别是为每种流单独选择一致性函数:动作流使用线性梯度缩放参数化,视频流保留LCM参数化,从根本上解决了梯度消失问题,而不是靠调参来弥补。

Q2:Flash-WAM压缩到一步之后,机器人的表现损失大吗?

A:在模拟基准RoboTwin 2.0上,从原始的25步视频加50步动作压缩到1步视频加1步动作,成功率从91.25%下降到81.41%,大约损失10个百分点;在LIBERO基准上从98.6%下降到95.1%,损失更小。在真实机器人实验中,原始模型成功率66.7%,Flash-WAM在1步视频加2步动作配置下达到60%,相比不做蒸馏直接减步的40%有显著恢复。

Q3:世界动作模型WAM和普通的机器人视觉-语言-动作模型VLA有什么区别?

A:VLA模型直接从当前画面预测动作,本质上是在用"看静态图"的方式做决策,对物理动态理解有限。WAM则先"脑补"未来一段时间的视频画面,再从预测的视频中推导动作,等于让机器人先在脑海里模拟一遍再行动。这种方式继承了大规模视频预训练的时空物理先验,在泛化到新场景和长时域任务上理论上更有优势,但代价是推理速度更慢,Flash-WAM正是为解决这个速度问题而提出的。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-