微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 加州大学圣地亚哥分校让机器人学会"先想后做":RoboTALES如何让机器人像人一样规划未来

加州大学圣地亚哥分校让机器人学会"先想后做":RoboTALES如何让机器人像人一样规划未来

2026-07-20 16:10
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-20 16:10 科技行者

这项由加州大学圣地亚哥分校研究团队完成的工作于2026年7月以预印本形式发布,论文编号为arXiv:2607.06018,感兴趣的读者可通过该编号查阅完整论文。

在开始之前,先做一个小小的思想游戏。假设你要完成一项任务:把一杯咖啡从咖啡机里取出来,放到桌子对面的客人面前。你不会在完全不思考的情况下就伸手去抓——你会先用眼睛确认咖啡杯的位置,脑子里大致规划一下路径,甚至提前预见到"如果咖啡太热,要换个握法"这样的细节。这个"先想再做"的能力,人类觉得理所当然,但对机器人来说,却是一道极难跨越的门槛。

RoboTALES正是为了跨越这道门槛而生的。

**研究的起点:机器人为什么总在关键时刻"失忆"**

当前最先进的机器人控制方法大致分成两条路。一条路是"无脑硬练",让机器人反复尝试、从失败中积累经验,这条路虽然最终能学会,但效率极低,就像让一个人通过不断撞墙来学会走路。另一条路是给机器人一个"世界模型",让它在脑子里先模拟一遍可能的未来,然后再决定怎么行动——这就更接近人类的思维方式了。

近年来,研究者发现了一个有意思的方向:用能够生成视频的人工智能模型来充当机器人的"想象力"。这类模型可以根据当前的画面,预测未来几秒钟的场景会是什么样子,机器人因此获得了某种"预见未来"的能力。这个方向看起来很美,但实践中有两个棘手问题。

第一个问题是"想偏了"。视频生成模型在训练时的目标是让画面看起来逼真,而不是让画面符合特定任务的目标。结果就是,机器人想象出来的未来虽然画面精美,但和它真正要完成的任务毫无关联——就像你让助手帮你想象"如何把花瓶从桌子挪到书架上",结果他给你画了一幅美丽的静物画,花瓶纹丝未动。

第二个问题是"没有章法"。面对一个复杂的长流程任务,比如"把炉子上的锅端下来,洗干净,再放回橱柜",机器人不知道该把这个笼统的指令拆解成几步,也不知道每一步之间的逻辑顺序。它就像一个厨师拿到了一道复杂菜谱,但只读了标题,没看步骤,于是手足无措。

RoboTALES的设计就是针对这两个问题量身定制的解决方案。

**一、给机器人一个"导演":层级规划器的工作原理**

RoboTALES框架里有一个专门负责"分解任务"的角色,研究团队叫它"规划器"(Planner)。这个规划器由一个强大的大型语言模型驱动——具体来说,使用的是谷歌的Gemini 2.5 Pro。

规划器的工作方式非常直观。当机器人接到一个任务指令,比如"准备制作西葫芦咖喱的食材",这句话对机器人来说太抽象了,它不知道从哪里开始。规划器会把这个高层指令分解成2到5个具体的、有顺序的子目标,比如"第一步:清洗、削皮并切丁西葫芦;第二步:切碎洋葱和番茄",以此类推。这些子目标然后被拼接在原始指令后面,形成一个更丰富的"增强版计划",作为视频生成模型的输入条件。

这个"增强版计划"的作用类似于给一部电影安排了详细的分镜脚本。原来的任务指令就像一句笼统的故事梗概,而有了规划器的加持,视频生成模型就拥有了一份完整的拍摄指南,知道在什么时间点应该呈现什么场景。正因如此,机器人想象出来的"未来视频"就不再是漫无目的的随机画面,而是沿着任务逻辑一步步推进的有意义的场景序列。

研究团队在实验中发现,子目标的数量会根据任务复杂程度灵活调整。对于简单任务,分成两步就够了;对于更复杂的多步骤任务,则会拓展到五步。这个灵活性确保了不同难度的任务都能得到恰当的分解粒度——既不会因为拆得太细而让模型应接不暇,也不会因为太粗糙而失去指导意义。

值得特别说明的是,这些子目标是在训练开始前就预先生成并缓存好的,不需要在每次机器人执行任务时都实时调用语言模型,因此推理时额外引入的时间开销极小,实验数据显示平均每个任务场景只多消耗约1秒钟——对于一个需要几十秒甚至几分钟才能完成的操作任务来说,这几乎可以忽略不计。

**二、给机器人一个"评委":VLM批评器如何纠偏**

然而,只有规划器还不够。即便有了详细的分镜脚本,视频生成模型有时仍然会"开小差"——生成的画面在视觉上很流畅,但并没有真正完成任务目标。这就好比一个演员拿到了完整的剧本,但在表演时自作主张改了台词,整个故事走向就偏了。

为了解决这个问题,RoboTALES引入了第二个关键角色:基于视觉语言模型的"批评器"(Critic)。批评器的工作就是当一名严格的考官,审查视频生成模型"想象"出来的未来画面,判断这些画面是否真正符合任务的目标要求,然后给出一个分数作为奖励信号。

批评器的工作机制借鉴了一种叫做"强化学习"的训练方式,而且采用了一种专门为扩散模型设计的技术,叫做DDPO(去噪扩散策略优化)。用更直白的话来说,就是把视频生成的每一步"去噪"过程都看作一个可以被评价的决策步骤,批评器给整个"想象过程"打分,分高则鼓励,分低则纠正。这个反馈信号会直接流回到视频生成模型的内部参数,调整它的"想象习惯",让它学会生成更符合任务目标的画面。

批评器在整个训练过程中是完全冻结的,也就是说批评器本身不会被训练或修改,只是充当一个固定的评价标准。研究团队为此测试了多种不同的奖励信号来源,最终选择了基于SBERT语义相似度的奖励方案,因为它在各类任务上表现出了更稳定的平均效果。

研究团队还做了一个精妙的对比实验,验证批评器的信号究竟有多可信。他们收集了360次任务执行的数据,按照批评器给出的奖励分数从低到高分成四组,然后统计每组的实际任务完成率。结果显示,奖励分数最低的那组完成率只有40%,而奖励分数最高的那组完成率高达88%,呈现出非常清晰的单调递增关系。这个发现说明批评器的评分和机器人真实的任务表现之间有很强的正相关——批评器说"这个未来想得不错",机器人真的更有可能成功完成任务。如果把批评器的分数用来预测任务成功与否,其准确率(AUROC)达到了0.72,远超50%的随机水平。

**三、让想象和行动"同步生长":联合训练的秘密**

除了规划器和批评器之外,RoboTALES还有第三个重要创新:视频生成模型和行动生成模块是一起训练的,而不是先训练一个、再训练另一个。

这个区别听起来像个技术细节,但背后的逻辑非常重要。如果先单独训练视频生成模型,再把它的输出特征喂给行动模块,那视频模型在训练时根本不知道"哪些信息对控制机器人最有用",它只会努力让画面看起来逼真,完全不考虑下游需求。这就像一个地图制作者只关心地图好不好看,完全不管使用者究竟想找什么路。

联合训练则不同。行动模块在训练时产生的误差信号,会直接流回到视频生成模型的解码器层中,告诉视频模型"你生成的这些内部特征,对控制机器人手臂有没有帮助"。视频模型因此会逐渐调整自己,不仅生成视觉上合理的画面,还会在内部编码出更有助于行动决策的空间、时间和语义结构。用研究团队的话来说,视频模型学会了"为了行动而想象",而行动模块学会了"从想象中行动"。

训练中使用了三种损失函数共同优化整个系统:视频扩散损失确保生成画面的视觉质量;批评器的策略优化损失确保生成画面的语义对齐;行动扩散损失确保从视频特征中解码出精确的控制指令。这三项损失以加权方式结合,研究团队通过参数调整找到了一个平衡点,让三者共同推动系统朝着"好看、符合目标、能正确控制机器人"的方向进化。

研究团队在附录中专门做了一个对比实验,把联合训练和分阶段训练放在四个不同任务上比较,结果联合训练在每个任务上都取得了更高的成功率,平均成功率也明显更高。这有力地支持了联合训练这一设计选择的合理性。

**四、在仿真厨房里的考试成绩:两大基准测试的详细结果**

RoboTALES在两个广泛使用的机器人仿真测试平台上接受了检验,一个叫做RoboCasa,一个叫做LIBERO10。

RoboCasa是一个专注于复杂厨房场景操作的大型仿真环境,测试覆盖了24种不同的操作任务,从把东西从柜台搬到橱柜、从水槽搬到台面,到开关各种门、抽屉、旋钮、水龙头和按钮,任务类型丰富且极具挑战性。每个任务在50次执行中计算成功率,最终取平均。

RoboTALES在RoboCasa上取得了64%的平均成功率,超越了此前所有对比方法。其中一些具体任务的数字尤其值得关注。在抽屉操作中,关抽屉任务成功率高达100%,开抽屉任务成功率也达到了80%。在按钮操作类任务中,咖啡机按钮任务成功率96%,微波炉开关任务分别达到96%。在门的操作中,开关双开门和关单开门的成功率都达到了94%和98%。

最具含金量的是"搬运放置"类任务,这是所有类型中难度最大的,因为它要求机器人在动态变化的场景中精确抓取并移动物体,任何一步出错都会导致失败。RoboTALES在这类任务上的平均成功率约为48%,而对比方法中表现最好的只有38%左右——提升幅度相当显著。

LIBERO10是另一个专注于多步骤厨房和家居场景的测试平台,包含10个不同的任务。RoboTALES在这10个任务上取得了97%的平均成功率。在这10个任务中,有两个任务达到了满分100%,其余任务的成功率也都在88%到98%之间。对比之下,此前表现最好的方法VideoPolicy的成功率是94%,第二名UVA是90%,而标准的扩散策略方法只有53%到58%。

研究团队还特别指出,他们只用了50条人类示范数据来训练,而对比方法中有些使用了300条示范数据,结果RoboTALES依然表现更好。这说明这个方法在数据利用效率上也有明显优势——在示范数据极为宝贵或难以获取的场景下,这一点格外重要。

**五、仔细拆解每个组件的贡献:消融实验的发现**

研究团队做了大量"拆零件"实验,逐个验证系统中每个组件的必要性。

关于规划器的贡献,研究团队对比了三种情况:第一种是直接把规划器生成的子目标注入一个未经任何适配训练的视频模型;第二种是用规划器条件进行完整训练但不加批评器;第三种是完整的RoboTALES方案。结果很清晰:第一种情况的成功率最低,甚至比不加规划器的基线更差——这说明如果模型没有经过专门训练,强行塞入结构化子目标反而会干扰模型;第二种情况比基线有提升,但不如第三种;只有把规划器和批评器结合起来完整训练,才能发挥最大效果。这个发现揭示了一个重要道理:工具本身的好坏,在很大程度上取决于使用者有没有被"训练"过如何使用这个工具。

关于批评器的贡献,研究团队从三个维度进行了测量。第一个维度是轨迹质量,用"机器人末端执行器(也就是机械手)与目标物体之间的距离"来衡量。RoboTALES在整个任务过程中展示出更低的距离方差,说明行为更一致、不容易偏离目标。第二个维度是抗干扰能力,实验者在推理时故意向输入图像中加入不同程度的高斯噪声,模拟真实环境中的视觉干扰。在轻微干扰时两种方法差异不大,但随着干扰增强,对比方法VideoPolicy的成功率急速下滑并趋近于零,而RoboTALES依然保持了明显更高的成功率——说明批评器对齐的语义表示具有更强的鲁棒性。第三个维度是动作平滑度,通过测量末端执行器的"加加速度"(也叫"jerk",描述加速度的变化率)来量化动作是否流畅。RoboTALES产生的运动具有更低的jerk值,意味着机器人的动作更流畅、更符合物理规律,而不是那种忽冲忽停的生硬动作。

关于动作窗口长度(也就是每次推理时预测多少步动作),研究团队测试了8步、16步和32步三种设置。实验结果呈现出一个"倒U形"曲线:窗口太短会让控制过于反应式、缺乏连贯性;窗口太长则容易积累误差、导致行为飘移;16步的设置取得了最佳的平衡点,这也是最终采用的配置。

**六、规划器的"出题质量"有多好:独立评估实验**

研究团队还请GPT-4o作为独立评委,对规划器生成的任务分解方案和直接用提示词生成的方案进行盲测比较,评判标准包括正确性、完整性、顺序合理性、可执行性和非冗余性共五个维度。

结果显示,规划器生成的方案在60%的比较中被判定为更好,直接提示词方案只在38%的比较中获胜,剩余2%的情况被认为平局。更有意思的是,规划器的方案平均只包含2.80个步骤,而直接提示词方案平均包含5.28个步骤。这意味着规划器不是靠"步骤更多因此更详细"来赢得评委的青睐,而是在步骤更少的前提下做到了更高质量的分解——更简洁、更精准、更符合任务执行的逻辑。

**七、训练之后视频生成能力有没有退化:通用视频质量验证**

有一个合理的担忧:把视频生成模型往机器人控制方向调教,会不会让它在其他视频生成任务上能力下降?毕竟,专注于厨房操作场景的训练数据和训练目标,与通用视频生成任务相差甚远。

研究团队用UCF101数据集(一个包含各种日常活动视频的通用视频数据集)做了验证实验。他们对比了原始的SVD(稳定视频扩散)模型和经过RoboTALES联合训练后的视频模型,在多个视频质量指标上进行测量。结果出乎意料地积极:经过联合训练的模型在所有指标上均优于原始模型。弗雷谢特距离(衡量生成视频与真实视频分布差异的指标,越低越好)从0.6715降低到0.2437,降幅达63.7%;与真实视频的余弦相似度从0.5955提升到0.8535;视频的多样性指标也从过于单一(0.72)改善到接近理想值(1.02)。这些结果表明,RoboTALES的训练过程不仅没有损害视频生成的通用能力,反而进一步改善了模型与真实世界视频动态的对齐程度。

**八、眼见为实:当基线失败,而RoboTALES成功时**

定量数据之外,研究团队还提供了直观的视觉比较案例。以"把计数台上的物品放入微波炉"这个任务为例,对比方法VideoPolicy在最初的抓取阶段就已经出现偏差,随着时间推移画面中出现了物理上不合理的变形,到任务结束时机器人手臂的位置完全错乱,任务彻底失败。与此同时,RoboTALES系统从开始到结束保持了清晰的场景一致性,机器人手臂稳定地执行了抓取、移动、放入的全过程,最终成功将物品放入微波炉。

类似的模式在其他任务中也反复出现:关闭水龙头任务中,基线方法的机械臂在中途出现路径混乱,而RoboTALES完成了完整的旋转动作;从炉子上搬运物品到台面的任务中,基线方法在搬运过程中丢失了对目标位置的追踪,RoboTALES则精确地完成了整个弧形移动轨迹;咖啡杯服务任务中,基线方法在靠近目标位置时出现了震荡和犹豫,RoboTALES则流畅地完成了最终放置动作。

**九、这项研究还有哪些局限**

研究团队在论文中坦诚地指出了三个尚未解决的问题,这种透明度本身也值得称道。

首先,批评器在整个训练过程中是固定不变的,它给出的奖励信号相对粗糙,只能评估整体的语义对齐程度,难以捕捉到更细微的进展信号——比如抓取质量是否足够好、物体放置位置是否足够精确。研究团队设想未来可以开发能够与机器人策略共同进化的可学习奖励模型,以提供更丰富的反馈。

其次,由于DDPO优化需要在每个训练步骤中进行多次完整的去噪采样来估计梯度,训练成本相当高——在两块NVIDIA A100 80GB显卡上,完整训练需要约6到7天。这对于研究资源有限的团队来说是一个实际门槛。

第三,这项研究目前完全基于仿真环境,还没有在真实物理机器人上进行验证。仿真环境和真实世界之间存在各种各样的差距,比如物体的重量和摩擦力、光线变化、传感器噪声等,都可能影响方法在现实场景中的表现。研究团队表示正在积极推进这方面的后续工作。

说到底,RoboTALES做的事情,是把人类"先想后做"的直觉明确地嵌入到机器人的学习过程中。通过让语言模型帮机器人分解任务、让视觉语言模型帮机器人评估自己的"幻想"是否靠谱,再让这两个反馈同时塑造机器人的内部表示,这个框架在复杂操作任务上交出了一份扎实的成绩单。当然,从实验室的仿真厨房到真实世界的真实厨房,还有很长的路要走。但这一步,走得很有说服力。

---

Q&A

Q1:RoboTALES在训练时需要多少示范数据?和其他方法相比,数据效率如何?

A:RoboTALES的训练只使用了50条人类示范数据。对比方法中有些使用了300条示范数据,但RoboTALES依然取得了更高的成功率。实验还显示,即使只有10条示范数据,RoboTALES也能达到约43%的成功率,与使用更多数据的对比方法相当。随着数据量增加到50条,成功率稳步提升到约53%,表现出良好的数据效率。

Q2:RoboTALES的规划器在推理时会增加多少时间开销?

A:开销非常小。研究团队实测了加入规划器和不加规划器两种情况下的每轮任务平均耗时,两者之间的差异约为1秒钟。因为规划器的任务分解结果在训练前已经预先生成并缓存,推理时只需读取缓存结果,无需实时调用大型语言模型,所以实际部署中几乎不影响机器人的运行速度。

Q3:RoboTALES的视频生成能力训练后会不会退化,只适用于机器人场景?

A:不会退化。研究团队在UCF101通用视频数据集上做了专项验证,结果显示联合训练后的视频模型在弗雷谢特距离、与真实视频的余弦相似度、视频多样性等多项通用指标上,全面优于原始未经训练的基础模型SVD。这说明面向机器人控制的训练不仅没有损害通用视频生成能力,反而进一步提升了模型与真实世界视频动态的一致性。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-