微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 上海人工智能实验室造出了一个"会预见未来"的机器人大脑,它能同时理解语言、预测未来、精准操控

上海人工智能实验室造出了一个"会预见未来"的机器人大脑,它能同时理解语言、预测未来、精准操控

2026-07-15 09:50
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-15 09:50 科技行者

这项由上海人工智能实验室(Shanghai AI Laboratory)物理智能团队完成的研究,以预印本形式发表于2026年7月,论文编号为arXiv:2607.04988,感兴趣的读者可通过该编号查阅完整论文。

当你告诉一个人"把那个橙色试管插入第三号孔",他脑海中会同时发生很多事情:理解你说的每个词、想象操作过程中试管和孔的相对位置、预判手指用力的方向和力度。这整个过程看起来自然而然,但对机器人来说,每一步都是一道难关。上海人工智能实验室的研究团队带来了一个名为**InternVLA-A1.5**的新系统,试图让机器人的"大脑"也能同时完成这三件事——理解语言、预见未来、精准行动。

机器人领域的研究者们长期面临一个两难困境:有一类系统擅长理解语言和图像,就像一个博览群书的学者,但它对真实物理世界的感知很薄弱;另一类系统通过观察大量视频学会了预测物体的运动规律,就像一个经验丰富的工匠,但它不太擅长理解复杂的语言指令。把这两种能力合并在一个系统里,听起来很美,但在实践中研究者们发现,当你把两种截然不同的学习目标强行塞进同一个系统时,它们往往会相互干扰、彼此削弱。

InternVLA-A1.5的解法颇为独特,核心思路可以用"悄悄学会预见"来形容:在训练阶段偷偷向一个强大的视频生成模型"借"来对物理世界的理解,把这种理解压缩成几十个特殊的"预见令牌",到了真正上阵工作的时候,这些令牌已经把世界知识内化为自己的一部分,视频生成器本身则可以彻底丢掉,机器人的反应速度因此没有任何损失。

---

一、为什么之前的方法总是"顾此失彼"

要理解这个研究解决了什么问题,不妨把机器人控制系统的训练过程想象成培养一个全能厨师。你希望这位厨师既能读懂任何菜谱(理解语言)、又能想象出菜做好后的样子(预见未来)、还能精确控制每一刀的角度和火候(精准动作)。

问题在于,现有的"培训方案"往往强迫这位厨师在学习切菜时把读书的时间全部砍掉,结果是刀工进步了但再也读不懂复杂菜谱;或者让他花大量时间在脑海里"播放"整道菜从原材料变成成品的完整视频,速度极慢,上菜时早就凉了。

在此之前的研究——包括这个团队自己做的上一版系统InternVLA-A1——尝试把未来视觉状态的预测和动作生成放在同一个训练框架里,确实带来了进步,但也暴露了三个顽固的问题。

第一个问题是"遗忘"。一旦系统开始大力学习动作生成和画面预测,原来从大型语言视觉模型里继承来的语言理解能力就悄悄退化了。就像一个原本中英文都流利的人,长期只说一种语言后,另一种就开始生疏。

第二个问题是"干扰"。不同类型的学习目标,比如预测下一帧画面像什么、预测手臂该往哪里移动、理解一句话的意思,它们在数学形式上完全不同,量级也差异很大,强行放在一起训练时,就像在同一个碗里搅拌水油和沙子,互相妨碍。

第三个问题是"重复造轮子"。当系统需要预测未来画面时,它往往从零开始学习"视频是什么样的",而这件事其实已经被Sora、WAN等强大的视频生成模型以极大的数据量和算力做得非常好了,但之前的方法没有利用这些现成的知识。

---

二、这套系统的三个核心设计

InternVLA-A1.5的整体架构可以用一个比喻来理解:把一位饱读诗书的学者(语言视觉模型Qwen-3.5 2B)和一位身手敏捷的专业助手(轻量级统一专家模块,约4.6亿参数)搭配在一起,两人共用同一间办公室里的会议桌(共享注意力层),但各自保留独立的工作台(独立的线性注意力层)。这个搭档关系既保证了信息共享,又避免了相互干扰。

**设计一:让学者继续上课**

绝大多数同类系统在开始学机器人控制之后,就停止给语言视觉模型继续"喂"语言和视觉理解任务的数据了。InternVLA-A1.5的做法是坚持让这位学者继续上课:在整个训练过程中,系统同时学习视觉问答任务(看图回答问题)和子任务预测(描述当前该做哪一步),以及一种叫做"离散动作令牌"的中间形式的动作预测。

这个设计的妙处在于,所有这些学习目标都被统一成同一种格式——下一个词是什么。问答题的答案是词,动作的编码也被变成词(通过一个叫FAST的工具把连续动作压缩成简短的词序列),子任务描述当然也是词。这样一来,不同任务之间的干扰大幅减少,学者的语言理解能力得到了保护甚至增强。

**设计二:用"预见令牌"借来世界知识**

这是整个研究最独特的部分。团队的思路是:与其让系统从零学会"预测未来画面长什么样",不如教系统学会"如何给一个已经很厉害的视频生成模型发出正确的指令"。

具体做法是这样的:系统里引入了50个特殊的可学习"预见令牌"(可以把它们想象成50张空白的便条纸)。这些令牌会仔细"阅读"当前的图像和语言指令,然后把"未来应该发生什么"的关键信息浓缩成一份简洁的摘要写在便条上。这份摘要随后被送给一个完全冻结的、强大的视频生成模型WAN2.2(参数量50亿),这个模型会根据摘要尝试生成未来4帧的画面,系统再对比生成结果和真实的未来画面,把误差反传回去,只更新这50张便条纸的写法,视频生成模型本身的参数纹丝不动。

经过大量训练后,这50张便条纸学会了用视频生成模型"看得懂"的方式来描述未来,这意味着它们已经内化了一个强大世界模型对物理规律的理解。到了真正执行任务的时候,视频生成模型直接丢掉,只保留这50张便条纸,机器人的反应速度因此保持在约0.1秒每步。

**设计三:两个"动作输出"互相补充**

系统最终会输出两路动作信息。第一路是来自学者(语言模型)的离散动作令牌,这是一种粗粒度的动作表示,主要在训练阶段起辅助收敛的作用。第二路是来自专业助手(统一专家模块)的连续动作,通过一种叫"流匹配"的技术从随机噪声中一步步推导出精确的关节角度或末端执行器位置。在推理阶段,只使用这第二路连续动作,精度和平滑性都更好,也更适合实时控制。

---

三、怎么训练:分三步走的菜谱

整个训练过程分三个阶段,就像做一道需要分步骤处理的复杂料理。

第一阶段叫"语言基础巩固",持续30万步训练。这一阶段让语言视觉模型同时处理问答数据和机器人数据,所有答案都统一成文字格式,系统学会把看到的场景描述成"下一步该干什么",同时把动作编码成词序列。这一步的核心目的是在不损坏语言理解能力的前提下,让模型开始认识机器人操作的世界。

第二阶段叫"预见与精准行动",持续60万步训练。专业助手模块在这一阶段正式加入,50个预见令牌也开始接受训练,通过冻结的视频生成模型WAN2.2的监督,学会压缩未来信息。与此同时,连续动作的流匹配预测也在这一阶段全面展开。整个第二阶段的损失函数是三项之和:语言交叉熵损失(保持语言能力)、视频预测损失(磨砺预见令牌)、动作流匹配损失(精准执行)。这三项的权重分别是1、1和10,动作执行得到了更强的强调。

第三阶段叫"针对性微调",持续6万步。每当要部署到特定任务或场景时,从第二阶段的预训练模型出发,用更小的学习率和更小的批量,在具体任务的示范数据上进行精细调整。视频生成分支在这一阶段可以选择性地保留来进一步打磨预见令牌。

---

四、喂给系统的食材:数据配方

InternVLA-A1.5在预训练阶段消化了两大类数据,总量相当惊人。

机器人操作数据来自六个来源,合计120万条机器人操作轨迹、8.61亿帧图像。其中约46%来自仿真环境,具体是一个名为InternData-A1的合成数据集,覆盖了各种机器人形态、技能类型和场景;另外54%来自五个真实世界数据集,分别是AgiBotWorld、UMI、DROID、Galaxea和RoboMind 1.0。这些真实数据集规模普遍比仿真数据小得多——最大的AgiBotWorld有20.6亿帧,最小的RoboMind只有540万帧——因此团队采用了一种两层分组的采样策略来平衡各来源的影响,刻意给那些规模小但场景多样的真实数据集更高的采样权重,防止仿真数据"一手遮天"。

多模态理解数据来自InternVLA-M1语料库,约300万条样本,分为四类:通用视觉问答(包含图片描述、OCR、知识问答,约63.7万条)、目标框定位(给出物体的边界框,约87.9万条)、点位定位(指出空间中的特定位置,约83.2万条)、末端执行器轨迹预测(预测机械臂的运动路径,约68.4万条)。这些数据的作用是防止机器人操作学习把语言视觉能力"冲淡"。

在混合采样上,机器人数据和多模态数据以15:85的比例被搭配使用,这意味着每个训练批次里约85%的样本都在强化语言和空间理解能力,只有15%直接驱动动作和预见学习。这个比例确保了语言模型的"根基"始终健康。

---

五、注意力掩码:信息流动的精心管控

为了让两个模块(学者和专业助手)既能协作又不互相干扰,研究团队设计了一套精细的"信息流动规则",在技术上叫做注意力掩码。

在语言模型一侧,规则和普通语言模型一样:只能看到当前位置之前的内容,不能"剧透"未来。这保证了语言建模的自然性。

在专业助手一侧,预见令牌和动作令牌被分成两组。预见令牌可以"读取"所有来自语言模型的上下文信息;动作令牌则可以额外读取预见令牌的信息,相当于先看了预见令牌写的便条,再来决定怎么行动。两组内部都允许双向交互,也就是说预见令牌们可以互相商量,动作令牌们也可以互相参照,这样可以更好地建模整个动作序列的一致性。

训练时有一个特别设计:离散动作令牌虽然存在于序列中(用于监督学者的动作预测),但专业助手被明确禁止去读取它们的内容。这个"防火墙"有两个作用:一是防止专业助手直接抄答案,二是避免离散动作预测和连续动作预测之间的梯度相互干扰。推理时离散动作令牌不再生成,专业助手直接利用缓存的语言模型上下文完成连续动作的去噪推断。

---

六、真实世界测试:四项实验的详细结果

团队在真实机器人上设计了四个任务来检验系统能力,并与物理智能公司的π0.5以及Motus系统进行了比较。

**试管分拣任务**是所有任务中最基础的一个,工作台上摆着橙色和蓝色两种试管,还有左右两个收纳盒,指令会告诉机器人用哪只手臂把哪个颜色的试管放进对应的盒子里。这个任务的设计里有一个"陷阱":训练时机器人只学过"左手拿蓝色放左盒"和"右手拿橙色放右盒",测试时会要求它完成"左手拿橙色放左盒"和"右手拿蓝色放右盒"这样从未见过的组合。如果机器人只是在复制记忆的动作,而不是真正读懂了指令,它就会失败。在总成功率上,π0.5达到77.8%,InternVLA-A1.5达到75.9%,Motus是64.8%。差距不大,但当拆分成"见过的组合"和"没见过的组合"来看,InternVLA-A1.5在没见过的组合上依然领先,说明它的优势在于真正理解指令而非死记硬背。

**试管插孔任务**难度更高,工作台上有一个带4个孔的试管架,指令要求机器人把指定颜色的试管插入指定编号的孔中。这需要精确的空间定位能力。训练数据有意留出了"蓝管插2号孔"和"橙管插4号孔"这两个组合,只在测试时评估。InternVLA-A1.5整体成功率72.5%,π0.5是51.7%,Motus是44.2%。在没见过的组合上,InternVLA-A1.5同样保持领先,领先π0.5约13个百分点。

**试管移位任务**要求把左架上指定颜色的试管移到右架上指定编号的孔,同样留有未见组合。InternVLA-A1.5整体成功率80.5%,领先π0.5的72.7%和Motus的56.2%。在未见组合上,InternVLA-A1.5达到83.3%,π0.5是60.0%,差距拉大到约23个百分点。

**金属有机框架合成任务(MOF)**是最复杂的一个,模拟真实化学实验室里的溶液配制过程。机器人需要按顺序完成13个子步骤:取来漏斗并插入圆底烧瓶、用右手抓起量筒、通过漏斗倒液体、归还量筒、取走漏斗归还原位、用左手搬起烧瓶放到搅拌器上、取出瓶塞密封烧瓶、按下搅拌器开关、回到初始位置。这些步骤必须严格按序执行,其中倒液体会改变烧瓶里的液面高度,这种场景变化只有真正"理解物理过程"的系统才能正确处理。结果非常突出:InternVLA-A1.5成功率76.4%,π0.5仅29.3%,Motus完全没能完成任何一次(0%)。团队认为这个巨大差距来源于两点:明确的子任务预测让系统始终知道自己处于整个流程的哪个阶段,而预见令牌则让系统理解了"倒液体"这种改变场景状态的动作的物理含义。

---

七、仿真基准测试:六项全部领先

在六个仿真基准测试上,InternVLA-A1.5同样取得了全面领先。

LIBERO是一个单臂7自由度机器人基准,包含空间、物体、目标、长程四个任务套件,InternVLA-A1.5在四个套件上的平均成功率达到98.9%,超过π0.5的96.9%以及所有其他方法,且在每个单独套件上均排名第一或第二。

LIBERO-Plus是LIBERO的"压力测试版",同一个在LIBERO上训练好的模型,直接在相机视角变化、光照变化、背景变化、物体布局变化等干扰下评测,无需任何额外训练。InternVLA-A1.5得到84.8%的总分,是所有方法中最高的,在背景干扰、光照变化和相机变化上尤其突出,显示出强劲的视觉鲁棒性。

RoboTwin 2.0是双臂机器人基准,包含50个任务,分干净场景和随机化场景两种设置。InternVLA-A1.5在干净场景下成功率93.3%,随机化场景下93.0%,两者相差不到0.3个百分点,说明系统对场景变化极为稳定,综合平均93.2%,超过所有基线方法包括Fast-WAM(91.8%)和LingBot-VA(92.2%)。

DOMINO是在RoboTwin基础上增加了运动物体的动态操控基准,难度显著更高。InternVLA-A1.5用在RoboTwin上训练的模型直接测试(零样本),成功率27.7%,超过此前最佳的Qwen-VLA-Instruct的26.6%;进一步在DOMINO数据上微调后提升到29.3%。

EBench是基于Isaac Sim的室内移动操控基准,涵盖长程、抓放、灵巧操作等多种技能。InternVLA-A1.5在验证集(已见任务)、验证集(未见任务)和测试集上的成功率分别为43.1%、32.8%和35.2%,三项均为最佳,且使用了比部分基线更少的训练步数(10万步对比π0.5的更多步数)。

SimplerEnv是真实机器人到仿真的迁移评测,测试模型在仿真环境中能否复现真实操作的成功。InternVLA-A1.5平均成功率80.8%,领先π0.5的57.1%超过23个百分点,在"把勺子放在毛巾上"这一任务上达到92.4%,在"把胡萝卜放在盘子上"这一任务上达到85.4%。

---

八、消融实验:每个设计到底有多重要

为了验证每个设计选择真的起作用,研究团队做了系统的"拆分测试":每次去掉一个组件,看成绩如何变化。

去掉视频预测损失之后,系统在四个基准上的成绩都出现了明显下滑,其中LIBERO-Plus从84.8%下降到78.0%,DOMINO从27.7%下降到25.3%,在零样本评测场景下跌幅最大。这说明视频监督信号确实帮助系统学到了更强的视觉鲁棒性和物理状态感知。

去掉预见令牌(保留视频损失但没有这50个特殊令牌)之后,跌幅进一步扩大:LIBERO-Plus降至77.9%,RoboTwin降至90.2%,DOMINO降至23.8%。这一结果说明预见令牌不只是一个传递信号的管道,它本身作为一种"结构化的未来信息接口",对于把视频模型的知识转化为动作控制有着不可替代的作用。

训练效率的对比同样说明了预训练质量的重要性:在RoboTwin微调阶段,InternVLA-A1.5的损失从一开始就处于比π0.5和InternVLA-A1更低的位置,收敛也更快,用相同的训练步数最终达到更低的损失值。这表明更扎实的预训练为下游适应提供了更平坦的优化"地形"。

研究团队还对预见令牌驱动的视频生成结果进行了可视化展示。给定当前帧,系统利用预见令牌生成的条件码驱动冻结的WAN模型预测未来4帧,在标准评测场景下,预测画面与真实画面在机器人关节位置、物体运动轨迹上高度吻合;在零样本测试中(训练时完全没有见过的场景),系统甚至能正确预测液体倒入烧瓶后液面上升的视觉变化,展示出超越纯运动学范畴的物理推理能力。

---

九、这个研究的边界在哪里

研究团队在论文中坦率地指出了两个尚待解决的局限。

当前的预见令牌只覆盖与一个动作块同等时长的未来(约50帧,对应几秒钟),因此系统吸收的是局部动作级别的物理先验,而不是长达数分钟的任务级别规划。未来如果能让预见令牌覆盖更长的时间跨度,系统可能具备更强的长程规划能力。

视频生成模型全程保持冻结、不做任何针对机器人场景的调整。这意味着系统能从视频模型那里借来的知识,受限于这个通用视频模型见过多少机器人操作场景。如果视频模型的预训练数据里机器人相关内容较少,预见令牌能学到的物理先验就相应受限。针对机器人操作领域对视频生成模型进行适当微调,有可能进一步提升效果。

---

说到底,InternVLA-A1.5做了一件很聪明的事:它没有试图重新发明关于"物理世界如何运作"的知识,而是设计了一种轻巧的接口,让机器人控制系统能够悄悄地"调用"视频生成领域多年积累的成果,而不必承担在推理时真的生成视频的巨大代价。这种思路就像是一个厨师学徒,他不需要亲自经历几十年的厨艺修炼,只需要学会如何向老厨师提出正确的问题,把那些问题的答案内化为自己的直觉,然后以自己的速度和精度完成烹饪。

这项研究对我们的日常生活意味着什么?机器人要真正进入家庭和工厂,最后一道坎不是力气或速度,而是能不能听懂"把那个还没开封的蓝瓶子放到第三格架子上"这样包含了多个变量的指令,而且是对从未练习过的具体组合也能正确执行。InternVLA-A1.5展示的结果——在完全没见过的指令组合上成功率依然领先——正是在解决这个最后一道坎。如果有兴趣深入了解技术细节,完整论文可以通过arXiv编号2607.04988免费获取。

---

Q&A

Q1:InternVLA-A1.5的"预见令牌"和直接让机器人生成视频有什么区别?

A:直接生成视频需要在每次决策时都运行一个50亿参数的视频生成模型,速度极慢,无法满足实时控制需求。预见令牌是50个经过专门训练的"信息压缩胶囊",在训练阶段通过视频生成模型的监督信号学会如何浓缩未来信息,训练结束后视频生成模型就被丢弃。推理时系统只需要运行这50个令牌,速度快得多,整个推理步骤约0.1秒完成。

Q2:InternVLA-A1.5在没见过的指令组合上为什么比π0.5表现好这么多?

A:核心原因在于语言理解能力的保护方式不同。InternVLA-A1.5在整个训练过程中持续进行视觉问答和子任务预测训练,保住了预训练语言模型对词义和逻辑关系的理解。当遇到"橙管插4号孔"这样从未示范过的组合时,它能独立理解"橙色""4号孔"各自的含义并组合执行,而不是依赖对训练示范的记忆。这种组合泛化能力在拥有更强语言基础时更为突出。

Q3:InternVLA-A1.5的训练需要多大规模的数据和算力?

A:预训练数据包括120万条机器人操作轨迹(8.61亿帧)和约300万条多模态问答样本。训练分三个阶段,第一阶段30万步、第二阶段60万步、第三阶段(针对性微调)6万步,前两个阶段批量大小均为1024,使用bfloat16精度。RoboTwin微调阶段在24块GPU上以每卡16的批量训练10万步。完整的预训练规模属于大型工业级研究投入,普通研究团队通常会从公开发布的预训练权重出发直接进行针对性微调。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-