这项由英伟达(NVIDIA)、斯坦福大学以及德克萨斯大学奥斯汀分校联合开展的研究,于2026年7月以预印本形式发布,论文编号为arXiv:2607.15275。有兴趣深入了解的读者可以通过该编号在arXiv平台查阅完整论文。
**一切从一个问题开始:机器人为什么"没有记忆"?**
假设你是一位外科医生,正在做一台持续五个小时的手术。你不可能每做完一个步骤,就彻底忘记之前发生的一切,再从头判断该做什么。你的大脑会一直保留着这台手术从开始到现在每一刻的记忆,这样你才能在第四个小时里,清楚地知道第一个小时你已经处理了哪根血管、现在该进行到哪一步了。
然而,绝大多数现有的机器人"大脑"并不是这样工作的。它们就像一个严重失忆的手术助手——每次眨眼之后,就只记得眼前这一秒发生了什么,完全不知道过去发生了什么。在机器人领域,这被称为"单步或短历史视觉运动上下文"——换句话说,机器人的视野只局限在当下这个瞬间,或者最多是几帧画面之前。
这种设计在简单任务里还说得过去,但一旦任务变得复杂,比如要在五分钟内完成一项包含十个连续步骤的装配工作,机器人就会像一个在密室里转圈的人,总是忘记自己刚才走了哪条路、绕过了哪面墙。
英伟达领导的这支研究团队决定从根本上改变这个局面。他们的答案,就是本文要介绍的核心成果:**RoboTTT**——一套让机器人策略能够记住、理解并利用超长历史经验的全新系统。
---
一、记忆的维度:从"瞬间记忆"到"五分钟长卷"
要理解RoboTTT有多不寻常,先来感受一下"量级差距"这个概念。
目前最先进的机器人基础模型,其视觉运动上下文长度大约在个位数到几十个时间步的范围内。换算成时间,也就是最多观察过去几秒钟的内容。RoboTTT则将这个上下文长度扩展到了**8000个时间步**——在每秒30帧的控制频率下,这相当于整整超过四分钟的连续历史。
这是什么概念?这比现有最先进机器人策略的上下文长度,足足多出了**三个数量级**,也就是一千倍以上的差距。更关键的是,RoboTTT做到这一切的同时,**并没有让机器人的反应变慢**。
传统方法中,如果你想让机器人记住更长的历史,就需要把所有历史信息都保存下来供随时查阅,但这会让运算量随时间线性增长——机器人工作了一分钟,要查阅一分钟的记录;工作了五分钟,就得查阅五分钟的记录,越来越慢。RoboTTT用一种全新的机制彻底绕开了这个瓶颈,后面会详细解释。
这套系统解锁了四种在现有机器人中从未出现过、或表现极其有限的能力:从人类演示视频中进行"一次性模仿学习"、在工作过程中持续改善自己的表现、在受到外力干扰后能自主恢复,以及在跨越数十个阶段的超长任务中保持稳定的高水平表现。
---
二、核心机制:用"快速笔记"代替"记忆相册"
RoboTTT最核心的技术创新,借用了一个叫做"测试时训练"(Test-Time Training,简称TTT)的思想。
通常来说,神经网络(也就是AI的"大脑")的学习过程分两个阶段:训练阶段更新参数,推理阶段(即实际使用时)参数冻结不动。这就像一个学生在课堂上学习,然后参加考试——考试时不能再临时修改记忆,只能用已有的知识回答问题。
TTT打破了这个惯例。它在神经网络内部引入了一种叫做**"快速权重"(fast weights)**的特殊参数。与普通参数(称为"慢速权重",在训练完成后就锁定不变)不同,快速权重在机器人实际执行任务的过程中,也可以通过梯度下降(AI学习的核心算法)持续更新。
用一个比喻来理解:慢速权重就像刻在石碑上的古老知识,永远不变;快速权重则像你手边的一本便签本,随时可以根据当前情况写下新的注记、划掉过时的内容、整理出此刻最重要的信息摘要。
在RoboTTT中,这本"便签本"是由一个小型神经网络(具体来说是一个两层的MLP,即多层感知机)来充当的。每当机器人接收到一帧新的观察画面,它就会更新这本便签本,把当前状态的关键信息写进去,同时自然地淡化掉不再重要的旧信息。当机器人需要决定下一步动作时,它不需要翻阅过去几千帧的"相册",而是直接查看这本高度浓缩的便签本——因此推理速度始终恒定,不随历史长度增加而变慢。
从数学角度来说,快速权重的更新遵循一个精确的规则:在每个时间步 $t$,系统将上一时刻的快速权重状态 $W_{t-1}$ 以及当前的"键"(Key)和"值"(Value)向量输入,通过最小化一个均方误差损失函数来更新快速权重,得到新的状态 $W_t$。然后,用这个更新后的 $W_t$ 对当前的"查询"(Query)向量进行计算,得到输出。整个"更新然后应用"的循环,在训练和推理时都持续进行,这就是信息被压缩进参数空间、又能随时被检索出来的关键所在。
---
三、架构设计:在巨人肩膀上加装"时间感知模块"
RoboTTT并不是从零开始构建的。研究团队选择了英伟达自家的**GR00T N1.7**作为基础,这是一个专为人形机器人和双臂机器人设计的视觉-语言-动作(VLA)基础模型——可以理解为机器人界的"GPT底座"。
在GR00T N1.7的架构中,动作生成部分由一个叫做"扩散变换器"(Diffusion Transformer,DiT)的模块负责,它通过逐渐"去噪"的方式生成机器人的动作序列。RoboTTT在这个DiT的每一层(共16层)的注意力机制层之后,都插入了一个TTT层。
这个设计的精妙之处在于分工明确:注意力机制层负责处理"当下这一刻"的所有信息——当前画面里有什么、机器人关节现在的状态、噪声化的动作序列——而TTT层则专门负责处理"时间维度上"的信息流动,也就是把来自不同时间步的信息整合起来,形成对历史的理解。
除了注意力层和TTT层,系统还在每个时间步的开头插入了16个"寄存器令牌"(register tokens)。这些寄存器令牌可以理解为专门的"信使"——它们能够在注意力层中自由地读取当前时间步的所有视觉-语言信息,然后再通过TTT层把这些信息传递到时间轴上。这样的设计避免了把所有视觉-语言令牌都传过TTT层(会带来巨大计算开销),而是用少量的"信使"来高效搬运关键信息。
为了防止新加入的TTT层一开始就"淹没"掉GR00T N1.7原有的知识,研究团队还引入了一个"tanh门控"机制。简单来说,TTT层的输出被乘以一个初始值接近于零(0.001)的可学习参数,再加到注意力层的输出上。这意味着训练刚开始时,TTT层的贡献几乎为零,机器人完全依赖原有的知识;随着训练深入,门控参数逐渐增大,TTT层的影响也越来越大,整个过程平滑过渡,不会产生突兀的"知识冲突"。
---
四、训练配方:两个让长序列训练成为可能的秘密武器
在架构之外,让RoboTTT真正能够处理8000步长序列的,是两项关键的训练技术。
**第一项技术:序列动作强制(Sequence Action Forcing)**
RoboTTT使用流匹配(flow matching)来训练动作生成——这是一种与扩散模型类似的技术,通过学习如何把"噪声动作"逐渐还原成"真实动作"来生成高质量的机器人行为。
训练时,模型需要同时处理整个时间序列上的多个动作块。一个容易犯的错误是,对序列中所有时间步的动作使用同一个噪声级别:要么全部处于"低噪声"状态(任务很简单),要么全部处于"高噪声"状态(任务极难)。这会让训练极不稳定——就像同时让一个学生面对一百道完全一样难度的题目,要么全都太简单没有收获,要么全都太难无从下手。
序列动作强制的做法是:**对序列中每个时间步的动作块独立采样噪声级别**。这样一来,同一个训练序列中,有些时间步的动作处于高噪声状态(模型需要从很嘈杂的输入中重建动作),有些处于低噪声状态(任务相对轻松),整体难度分布更加均衡,训练因此稳定了许多。实验证明,去掉这一设计会让模型的闭环控制性能大幅下滑,机器人会产生不精准的运动,无法推进任务。
**第二项技术:截断时间反向传播(Truncated BPTT)**
训练神经网络时,需要通过"反向传播"来计算梯度并更新参数。对于序列模型,这意味着要沿着整个时间序列往回传播梯度,同时在内存中保存每个时间步的中间计算结果。序列越长,需要的内存就越多——对于8000步的序列来说,这个内存消耗会直接超出GPU的承载极限。
截断时间反向传播的解决方案简洁有力:把长序列切分成若干个较短的"段",梯度只在每个段内部传播,到段的边界就截断。但关键在于,**快速权重本身并不截断**——它携带着压缩后的历史信息,从一个段的末尾传递到下一个段的开头,就像接力赛跑一样,确保整个序列的上下文信息连续流动。这样,GPU内存消耗由段的长度决定,而不是整个序列的长度,从而在固定的硬件预算下,支持任意长度的训练上下文。
这两项技术合在一起,就构成了RoboTTT的完整训练配方,让模型可以在现实可行的硬件条件下,真正地从超长历史中学习。
---
五、从历史中学习:两种全新的机器人能力
拥有了长上下文处理能力之后,研究团队设计了两种特殊的训练方式,让机器人能够从不同类型的历史经验中学习。
**能力一:从人类演示视频中一次性学会新任务**
机器人能不能看一段人类演示视频,然后立刻模仿人类的做法?这种"一次性模仿学习"一直是机器人领域的一个核心挑战。RoboTTT通过长上下文条件化给出了一个令人眼前一亮的解法。
具体做法是:在训练时,把一段人类演示视频和一段机器人完成同一任务的轨迹拼接在同一个训练序列里。视频部分的数据只负责更新快速权重(相当于让机器人"看"并"理解"人类在做什么),而不计算动作损失(机器人不会试图在这个阶段输出动作);机器人轨迹部分则在更新了快速权重之后,正常计算动作损失,让模型学习如何在"看懂了视频之后"输出正确的动作。
这样训练出来的模型,在实际部署时就可以做到:给机器人看一段人类组装某个特定配置的电路板的视频,机器人就能在从未见过这个配置的情况下,复现人类的组装过程。
**能力二:DAgger蒸馏——从失败中提炼纠错能力**
DAgger(Dataset Aggregation)是机器人学习领域的一种经典技术,简单来说就是:让机器人执行任务,当它犯错时,人类操作员介入并给出正确的纠正动作,然后把这些纠正动作加入训练数据,让模型从失败-纠正的对应关系中学习。
标准的DAgger训练方法会把人类纠正动作作为训练目标,但直接抛弃了机器人的错误动作——毕竟,错误动作不应该被模仿。然而,研究团队发现,这些"失败动作"其实包含着非常重要的信息:正是这些失败,才让后续的纠正动作有了具体的含义。知道机器人"在这一步做错了什么",才能真正理解"为什么纠正动作要这样做"。
RoboTTT的DAgger蒸馏采用了一种不对称的角色分配:所有执行过的动作(无论是机器人的错误动作还是人类的纠正动作)都会更新快速权重,但**流匹配损失只在人类纠正动作上计算**。
这意味着什么?快速权重见证了"失败-纠正"的完整过程,把这种映射关系压缩进了自己的参数空间。到了实际部署时,当机器人犯下类似的错误,快速权重就能检索出对应的纠正模式,引导机器人进行自我纠正——完全不需要人类在场干预。研究团队将这一机制类比为"算法蒸馏"(Algorithm Distillation)在机器人领域的具体落地:把人类纠正的算法逻辑,蒸馏进机器人的快速权重之中。
---
六、实验场景:五分钟、十个步骤的"机器人奥运会"
研究团队设计了三个难度递增的真实机器人实验任务,全部在一个叫做YAM的双臂双手机器人平台上进行,并配备了顶部、底部、左腕、右腕四个RGB摄像头。
第一个任务叫"Pup Go Car"(小狗跑车),机器人需要组装一辆玩具车的车顶和第一个车轮,过程包括拧螺丝、用电钻、双手协作传递工具、把车翻转过来等步骤,平均完成时间约两分钟。
第二个任务叫"Circuit"(电路板),机器人需要在一块电路板上安装两到三个电路元件,元件的种类和安装顺序会变化,共有约80种不同的配置组合,训练时只见过其中20种,测试时面对的是从未见过的另外60种。这个任务还可以通过一次性人类演示视频来指定目标配置,平均完成时间约一分钟。
第三个任务叫"Gear Bot"(齿轮机器人),这是三个任务中难度最大的。机器人需要在底盘两侧各安装一个齿轮和两个车轮(需要两次翻转底盘),然后安装红色的"机器人头部",最后拿起遥控器推动摇杆让齿轮机器人动起来——整整十个阶段,平均完成时间长达五分钟。
研究团队共采集了Pup Go Car任务8小时、Circuit任务6小时、Gear Bot任务5小时的真实机器人操作数据用于训练。
---
七、实验结果:数字背后的真实含义
研究团队将RoboTTT与三个基线模型进行了对比。第一个基线是原版GR00T N1.7,只使用当前时刻的单帧观测;第二个是GR00T N1.7 Hist.,使用当前帧加上一帧历史;第三个叫GDN(门控DeltaNet),使用与RoboTTT相同的架构框架,但把TTT层换成了"门控DeltaNet"层——这是另一种循环记忆机制,可以压缩历史信息,但不依赖测试时的梯度下降来更新。
评测指标分为两种:一是基于详细评分表的"任务完成分数"(0到1之间,换算成百分比),二是完整完成任务的试验次数。
在三个任务上的平均完成分数上,RoboTTT达到了79%,比单步基线GR00T N1.7的42%高出了87%,比表现最好的基线GDN的56%高出了41%。
Gear Bot任务的结果最能说明问题:在10次试验中,RoboTTT有2次完整完成了所有十个阶段——而其他三个基线方法,一次都没有完整完成过。换句话说,面对这个持续五分钟、包含十步操作的复杂任务,只有RoboTTT能够真正"做到底"。
在Pup Go Car任务中,GR00T N1.7 Hist.(带一帧历史的版本)的表现反而比完全没有历史的GR00T N1.7更差——39.5%对比57%。这揭示了一个容易被忽视的问题:粗糙地堆砌历史帧,反而会引入虚假的时间关联,导致机器人在推理时出现"时间错位",弄不清自己现在处于什么状态。历史不是越多越好,关键在于如何有效地利用历史。
---
八、上下文长度是一个新的缩放轴
研究团队还专门研究了一个更深层的问题:随着预训练时使用的上下文长度从128步增加到8000步,机器人的实际表现会如何变化?
实验结果呈现出一条清晰的上升曲线:RoboTTT的任务完成分数随预训练上下文长度的增长持续稳步攀升。从128步时接近于零的表现,一路提升到8K步时的71.5%;8K步版本比1K步版本高出63%,比最好的短上下文基线GR00T N1.7 Hist.高出57%——而且从图像上看,曲线还没有呈现出任何饱和的迹象,意味着继续增加上下文长度可能还会带来进一步提升。
相比之下,GDN基线完全没有表现出这种随上下文长度增长而改善的趋势。研究团队认为,根本原因在于两种机制的本质差异:GDN的线性关联状态更新是固定形式的,没有办法通过更长的训练序列来"元学习"自己的更新方式;而RoboTTT的快速权重初始化 $W_0$ 以及更新动态,都可以通过更长的训练序列中更多次的梯度更新步骤来持续优化。
这是机器人领域第一次观察到"预训练上下文长度"作为一个独立的缩放维度带来持续的闭环性能提升,类似于在大语言模型领域观察到的"上下文窗口是一个重要的缩放轴"这一现象。
---
九、一次性模仿与抗干扰:长上下文的具体体现
在Circuit任务中,研究团队专门测试了一次性模仿学习的能力。为此他们收集了额外的人类演示视频——人类手动拼接电路板,机器人在旁边静止不动,四个摄像头完整记录整个演示过程。训练时,对于训练集中的20种配置,每种收集了5到20段不同初始布局的人类视频,并将视频与机器人轨迹拼接成完整的训练序列,视频部分的流匹配损失被屏蔽。
测试时,面对60种从未见过的电路配置,机器人只能看到一段人类演示视频(系统任务提示词对所有配置都一样,是"组装电路板",不包含任何关于具体配置的信息),然后独立完成组装。
结果是:RoboTTT在10次试验中成功完成了6次,任务完成分数达到65%;而GDN只有33%的任务完成分数,且没有一次完整成功,经常拿错元件或以错误顺序安装。这表明,拥有循环记忆的GDN虽然能在某种程度上"编码"上下文信息,但在真正需要"检索和利用"演示信息时,它的能力明显不足;而RoboTTT通过梯度下降更新的快速权重,能够在需要时精准检索出演示中展示的配置信息。
在抗干扰实验中,研究团队在Pup Go Car任务中额外施加了人为干扰:机器人安装好黄色车顶后,人类把车顶取走;或者机器人安装好轮胎后,人类把轮胎取走。能够利用自身历史的模型,应该能意识到刚刚完成的工作被打乱,并返回到安装阶段重新完成。为此收集了30分钟的干扰数据并与任务数据一起训练。
在车顶干扰测试的20次试验中,RoboTTT成功恢复了15次,GDN恢复了13次,而最好的短上下文基线只恢复了10次。在轮胎干扰测试中,RoboTTT和GDN都恢复了18次,显著优于短上下文方法。这说明对自身历史的长上下文条件化,确实能够增强机器人在任务执行过程中应对突发扰动的能力。
---
十、DAgger蒸馏的实际效果:自我纠错能力的量化
在Pup Go Car任务上,研究团队系统比较了不同DAgger数据使用方式的效果。他们分别用RoboTTT和GR00T N1.7作为基础策略,各收集了50条带有人类干预的DAgger轨迹,共100条。
标准DAgger方法(只用人类纠正动作训练)在四个方法上平均带来了9%的提升,在两个序列模型上平均带来了13%的提升。而DAgger蒸馏(快速权重接触完整交互历史,但损失只在人类纠正部分计算)在同样的数据上带来了平均33%的提升——RoboTTT提升36%,GDN提升29%。
一个对照实验证实了"失败动作作为上下文"的核心价值:把GR00T N1.7直接在包含机器人失败动作的完整轨迹上训练(也就是把错误动作也当成模仿目标),其结果与只训练人类纠正动作完全相同,都是57%的完成分数。换句话说,对于不能利用历史上下文的模型来说,失败动作的信息完全是无用的;而对于RoboTTT来说,这些失败动作作为快速权重更新的上下文输入,极大地增强了模型的在线纠错能力。
这种纠错能力的典型表现,就是机器人在电钻对准螺丝时发现未能接触,会自动抬起手臂重新对准再试,甚至经过两次调整后才成功——这种行为完全是从DAgger蒸馏中自发涌现的,无需人类在实时操作中给出任何指令。
---
十一、设计细节的消融实验:每个零件为何不可或缺
研究团队还通过消融实验(逐一去掉或替换某个设计组件,观察性能变化)验证了各个设计选择的必要性。
去掉序列动作强制之后,模型的闭环控制性能大幅下滑,机器人的动作变得不精准,无法推进任务流程。用线性层代替MLP作为快速模型时,性能比完整版本低了27%,尽管仍然好于没有历史的GR00T N1.7基线——这说明快速模型的非线性表达能力对于压缩复杂的机器人历史至关重要。
在渐进式构建RoboTTT的实验中,从只让TTT层处理状态令牌开始,加入动作令牌之后提升了23%(机器人因此能感知自己的历史动作,更好地理解环境动态),再加入寄存器令牌之后又提升了18%。而同样数量的寄存器令牌加到GR00T N1.7上却没有任何提升,说明寄存器令牌的价值,来自于与TTT时间建模机制的协同配合,而不是单纯的参数数量增加。
---
**归根结底,RoboTTT意味着什么**
说到底,RoboTTT回答了一个既简单又深刻的问题:如果给机器人一个足够大的"记忆容量",并且教它如何有效地利用这段记忆,机器人能做到什么?
答案是:它能像人一样跟踪自己在一项长任务里走到了哪一步,能在犯错后自我调整,能看懂人类的演示并复现,能在遭受外力干扰后冷静恢复。这些能力,听起来理所当然,却是机器人领域长期以来难以跨越的鸿沟。
这项研究还带来了一个对整个领域影响深远的发现:预训练上下文长度,就像模型参数量和训练数据量一样,是机器人基础模型的一个独立的缩放维度。更长的预训练上下文,持续带来更好的实际表现,而且目前还没有看到天花板。这意味着,未来在机器人基础模型的研究与开发中,"给模型更长的记忆"应当和"给模型更多的参数"、"给模型更多的数据"并列,成为一个核心的追求方向。
当然,这项研究也坦诚地承认了一些还没有解决的问题。更长的预训练上下文会显著增加训练成本,研究团队在16块NVIDIA GB200 GPU上进行了30000步的预训练,然后针对每个下游任务进行了20000步的微调,计算资源的需求相当可观。此外,虽然RoboTTT大幅提升了任务性能,它仍然不能处理所有可能的失败模式——与强化学习结合,直接对任务成功率进行优化,是研究团队认为自然的下一步。TTT层本身的训练目标,目前还是通用的均方误差,是否可以设计出专门针对机器人任务特性的TTT目标,也是值得探索的方向。
感兴趣的读者可以通过arXiv编号2607.15275,在arXiv.org上查阅完整论文,或访问 research.nvidia.com/labs/gear/robottt 观看实验演示视频,那里有机器人完成五分钟长任务、从人类视频学习组装、以及在受到干扰后自我恢复的完整录像。
---
**Q&A**
Q1:RoboTTT的"快速权重"和普通神经网络的参数有什么区别?
A:普通神经网络的参数(慢速权重)在训练完成后就锁定不动,实际使用时完全不变。快速权重则不同,机器人在执行任务的整个过程中,快速权重会持续通过梯度下降更新,随时把当前观察到的新信息压缩进去,同时淡化不再重要的旧信息。打个比方,慢速权重是刻在石碑上的知识,快速权重是随时可以增删的便签本。
Q2:RoboTTT能处理8000步上下文为什么不会变慢?
A:传统方法要查阅历史,就得把所有历史帧都保存下来,历史越长查询越慢。RoboTTT不保存历史帧,而是把历史信息持续"压缩写入"快速权重这个小型神经网络的参数中。机器人做决策时,直接查阅这个已经浓缩好的参数,查阅时间始终恒定,不随历史长度增加而变慢。
Q3:DAgger蒸馏和普通DAgger训练有什么核心区别?
A:普通DAgger训练只用人类的纠正动作作为学习目标,直接丢弃机器人的失败动作。DAgger蒸馏则保留了失败动作的角色,但用法不同:失败动作用来更新快速权重(让模型"看到"失败是怎么发生的),而流匹配损失只在人类纠正动作上计算(让模型学习纠正应该怎么做)。这样,"失败-纠正"的完整映射关系被蒸馏进快速权重,机器人部署时能自主实现类似的纠错行为。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。