微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 上海AI实验室造出给机器人"体检"的仪器——当四款顶尖机器人大脑拿到同一份试卷,成绩单藏着哪些惊天秘密?

上海AI实验室造出给机器人"体检"的仪器——当四款顶尖机器人大脑拿到同一份试卷,成绩单藏着哪些惊天秘密?

2026-06-29 13:45
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-29 13:45 科技行者

这项由上海人工智能实验室联合西安交通大学、清华大学人工智能产业研究院、上海交通大学、浙江大学、清华大学、同济大学及中国科学技术大学共同开展的研究,以预印本形式发表于2026年6月,论文编号为arXiv:2606.18239,有兴趣深入了解的读者可通过该编号查询完整论文。

当一个学生在数学卷子上拿到80分,另一个学生同样拿到80分,这两个人真的一样聪明吗?不一定——也许第一个人代数满分但几何是零蛋,第二个人几何很强但代数勉强及格。平均分相同,能力画像却截然不同。机器人领域正面临完全一样的困境:现在最先进的"机器人大脑"(研究者称之为通用操控策略)在各种测试中都报告一个综合成功率,但这个单一数字完全无法告诉我们这个机器人到底擅长什么、在哪里会出糗。正是为了解决这个问题,上海AI实验室的研究团队打造了一套全新的"体检仪器",取名EBench。

一、为什么一个分数远远不够

现有的机器人测试方法,大多像是只考了一门课就给出总成绩。有些测试平台专门考桌面上抓取物体,有些只测在房间里走来走去,有些只看单一动作。更大的问题是,哪怕测试结果显示两款机器人大脑的综合成功率非常接近,你也完全不知道它们各自的短板在哪里,也不知道换个环境之后哪个更抗打。

研究团队把这个困境比作结构性缺陷——不是某个工具不好用,而是整个评测框架的设计本身就缺少了关键的诊断维度。他们提出了三个核心问题:这个机器人大脑哪里强?哪里会崩?当它面对从没见过的场景、物体或者指令时,性能会怎么变化?EBench就是为了系统性地回答这三个问题而生的。

二、这份"体检套餐"里装了什么

EBench包含26个精心设计的操控任务,覆盖9种不同场景——卧室、浴室、厨房、客厅、书房、餐厅、超市、工业环境和物流仓库。这26个任务被分成三大家族:第一类是移动抓取与放置任务,共10个,机器人需要在空间里移动并完成搬运,每次任务大约需要600到1000个仿真步骤;第二类是移动长时序任务,共9个,要完成多个连续步骤的复杂动作序列,每次任务可能需要3000到5000步;第三类是桌面精细操作任务,共7个,要求毫米级甚至亚厘米级的精度,比如把钉子插进洞里、拧紧螺母或者安装齿轮,每次任务需要1500到3500步。整个仿真系统以每秒60步的物理频率运行,最长的任务相当于约83秒的真实机器人运作时间。

每个任务都被打上了五个维度的标签,就像给每道菜标注了食材、烹饪方式、难度、口味和出餐时长。这五个维度分别是场景类型、基本动作技能、时间跨度、精度要求和操作模式。基本动作技能细分为11种,包括抓取、放置、推、拉、按压、插入、倒液体、翻转、扫、传递和移动。精度则分为低精度(误差10厘米以上可接受)、中精度(误差在1到10厘米之间)和高精度(误差必须小于1厘米)。时间跨度分为短任务(不超过2000步)和长任务(超过2000步)。操作模式则区分移动模式和固定精细模式。

这样的设计意味着,一个综合成功率可以被拆解成一张能力坐标图,而不是一个意义模糊的总分。正如用一张成绩单同时展示语文、数学、英语、理化的各科成绩,远比只给出总分有用得多。

三、数据从哪里来:两条生产线同时开工

收集训练数据是整个体检体系的基础工程。研究团队面临一个棘手的矛盾:精细操作任务太复杂,程序自动生成的动作轨迹根本做不到,必须靠人手把手示范;但长时序移动任务又漫长而繁琐,靠人一步步示范效率极低,还容易在中途出错。为了解决这个矛盾,团队设计了两条并行的数据生产线。

针对7个精细操作任务,团队采用了一套"演员跟随"的远程操控装置:操作员控制一个与机器人结构完全对应的操控手柄,机器人实时复制每一个细微动作。这种方式能保留操作员在面对复杂接触时的直觉性微调,比如把钉子对准孔洞时那种微妙的手感反馈,是任何自动化程序都难以替代的。每个精细操作任务通过这种方式积累了400个示范片段。

针对另外19个移动和长时序任务,团队采用了截然不同的方式:操作员只需要标注出几个关键的空间位置(就像在地图上标记路标而不是描述每一步走法),然后由一个叫做cuRobo的运动规划算法自动计算出连接这些路标的完整、平滑、无碰撞轨迹。这种方式可以批量生成大量示范片段,而且生成的轨迹还能在不同背景、不同物体外观、不同光照条件下重新渲染,自然产生出各种泛化变体。每个移动任务和每个长时序任务各积累了200个运动规划示范片段。

整个训练数据集最终包含9187万帧画面、6600个完整示范片段,累计时长91.4小时,以LeRobot格式组织存储。

四、考卷分成几种:从熟悉到陌生的四重考验

EBench的测试集设计得颇为考究,不只是检验机器人在熟悉环境里能不能成功完成任务,更重要的是测试它在陌生情况下的适应能力。研究团队设计了四种泛化维度,每种维度都代表一种"陌生感"来源。

第一种叫背景泛化:换掉场景的墙面纹理、地板图案和光照条件,但保持物体和指令不变。这相当于把同样的任务搬到了装修风格完全不同的房间里做。第二种叫物体泛化:换掉要操作的具体物体,用同一类别里形状不同的新物体替代,比如原来抓的是圆形苹果,现在换成了外形不同的另一种苹果。这涉及机器人对物理世界的真实理解能力,因为不同形状的物体重心不同、抓取方式也不同。第三种叫指令泛化:用不同的说法描述同一个任务目标,比如"把苹果放到果盘里"换成"将苹果移至水果盆中"。这测试的是机器人对语言的理解是否真正灵活,还是只认识固定搭配。第四种叫混合泛化:同时换掉背景、物体和指令,三重陌生感叠加在一起。

至关重要的一点是,训练集和测试集在资产层面完全隔离——训练时见过的场景纹理、物体实例和指令措辞,在测试集里一个都不会出现。这保证了测试结果是真实的泛化能力,而不是对训练数据的死记硬背。

验证集分为两部分:Val-Train包含130个分布内的片段(每个任务各5个),Val-Unseen包含154个使用了陌生物体实例的片段。正式测试集包含510个片段,跨越全部四种泛化维度(大多数任务各20个,两个长时序任务各15个)。

五、送上考场的四位"考生"

研究团队选取了目前最具代表性的四款通用视觉-语言-动作模型(可以理解为能同时看图、读指令、控制身体的机器人大脑)参与测评:π0、π0.5、XVLA和InternVLA-A1。

π0由Physical Intelligence团队开发,采用一种叫做流匹配的方式生成动作序列,基于大规模多机器人预训练数据。π0.5是π0的升级版,具备更强的开放世界泛化能力。XVLA由上海AI实验室等机构研发,将视觉-语言理解和动作执行通过模块化解码器分离开来处理。InternVLA-A1同样来自上海AI实验室,结合了强大的视觉表征和分层规划机制。

为了保证比较的公平性,所有四款模型都在完全相同的条件下进行了微调训练:20万次梯度更新步骤、批次大小128、AdamW优化器配合余弦学习率调度,峰值学习率设为1e-5。观测输入包括来自左、右和顶部三个视角的224×224像素RGB图像,加上机器人本体的姿态状态信息和自然语言指令。每次预测50步的动作序列,但实际执行时只执行前30步,然后重新预测,这样的设计既能利用模型的前瞻能力,又不会因为预测太远而失控。因为仿真渲染器本身存在一定随机性,每个模型都被独立评测三次,报告均值和标准差。

六、四份成绩单:相似的总分,迥异的能力图谱

四个模型的综合测试成功率出奇地接近,落在24.4%到29.5%这个狭窄的区间里——π0是24.4%,XVLA是24.7%,InternVLA-A1是27.6%,π0.5以29.5%领先。乍一看,这四个学生似乎旗鼓相当。但当研究团队把成绩单按科目拆开来看,画风就完全不同了。

关于"留住成绩"的能力,即模型在熟悉环境里表现好、在陌生测试集里也能保持的能力,π0.5做得最好:它在熟悉场景的验证集上拿到32.1%,在正式测试集上仍然保持29.5%,保留率高达0.92。换句话说,它在熟悉环境里学到的东西,九成以上能带到陌生环境里用。相比之下,InternVLA-A1在熟悉场景里拿到了最高的33.1%,但在陌生物体版本的验证集上骤降到20.8%,保留率只有0.83,说明它的高分更多是"认脸"而非真正理解。π0的保留率最低,只有0.80,过拟合训练数据的倾向最明显。

按操作模式拆分时,最触目惊心的是InternVLA-A1:它在移动操控任务上的成功率和π0.5相当,约为34.7%,但在精细固定操作任务上只有5.8%,移动与精细之间相差了整整29个百分点。这说明它非常擅长规划"走去哪里、大概放在哪里",但在需要毫米级接触控制的场景里几乎完全失效。π0的表现则最为均衡,移动和精细之间只差了11个百分点,虽然绝对值不如π0.5高,但两种能力的平衡程度是最好的。

按精度拆分时,在要求误差小于1厘米的高精度任务上,π0以13.8%的成功率领先,其他三个模型都跌入个位数。在低精度任务上,π0.5以44.2%独占鳌头,其他模型聚集在35%左右。按时间跨度拆分时,短任务对所有模型都相对友好,成功率集中在24%到32%之间;长时序任务则拉开了差距,InternVLA-A1以29.1%领先,而XVLA从短任务的28.9%骤降到长任务的13.5%,暴露出它的模块化解码器在处理需要长期规划的任务时存在明显短板。

按基本动作技能拆分时,没有任何一个模型能包揽全部11种技能。π0在拉(Pull)和按压(Press)上分别拿到47%和50%的高分;XVLA在推(Push)上高达73.8%,但传递(Handover)只有5.8%;InternVLA-A1擅长移动(Move)和扫(Sweep),但按压和翻转(Flip)得了0分;只有π0.5做到了在所有11种技能上都没有出现灾难性零分的情况。按场景拆分时,π0.5在卧室、浴室、客厅场景表现最好;InternVLA-A1在厨房和餐厅场景领先;XVLA则在超市场景拿到了最高成绩。这些能力版图的交叉与错位,是任何单一总分都无法反映的深层信息。

七、随着训练时间增加,谁的成绩涨得更稳?

研究团队还追踪了四个模型在训练过程中(每训练2.5万步评测一次,共评测到20万步)的成绩变化曲线,分别绘制了在熟悉验证集和正式测试集上的曲线对比。两条曲线之间的纵向间距,代表了"在熟悉环境里学好了但没法带到陌生环境"的程度,间距越小越好。

π0.5的两条曲线几乎同步爬升,间距始终保持较小,到20万步时达到最高的测试成绩,体现出最稳健的泛化能力。π0的成绩也在稳步提升,但到后期两条曲线的间距开始变大,说明后期增加的训练更多是在强化对训练数据的记忆,而不是真正提升泛化能力。XVLA的测试集曲线有些波动,一度出现非单调性(也就是训练更多反而成绩短暂下滑),最终在20万步时恢复并达到不错的水平。InternVLA-A1则在熟悉验证集上取得了最强的最终成绩,但测试集的间距也是最大的,表明额外训练主要是在帮助它更好地应对它见过的分布,而非开拓未知领域。

八、四种陌生感,哪个最让机器人头疼?

在泛化维度的专项分析中,研究团队发现了一个清晰的难度层次结构。背景变化和指令措辞变化对四个模型影响都较小,它们在这两种扰动下仍能维持27%到35%的成功率,说明这些视觉感知层面和语言理解层面的变化对当前模型来说相对容易适应。

然而,物体替换带来的冲击要大得多,成功率降至21%到29%。这说明当要操作的物体换成了从未见过的新形状、新重量时,模型对物理世界的真实理解能力就会暴露出明显的不足。而当背景、物体和指令三种变化同时叠加(混合泛化)时,成功率进一步降至18%到23%,组合性的分布偏移带来的麻烦远超单个因素的简单叠加。

在四个模型中,π0.5在背景变化、物体替换和混合扰动这三种条件下都是最强的基准;InternVLA-A1则在指令措辞变化这一维度上表现最好,它的语言理解模块似乎对指令的多样化表达更为鲁棒。

九、预训练到底有多重要:用三个平台做的一次对比实验

研究团队还追问了一个很多从业者关心的问题:大规模预训练(也就是在正式训练任务之前,先用海量通用数据让模型学习世界知识)对模型最终表现究竟有多大帮助?为了回答这个问题,他们比较了五款模型在"有预训练"和"从零训练"两种条件下的表现,并且在EBench、LIBERO和RoboTwin 2.0三个不同平台上同时进行了比较。

其中Fast-WAM和StarVLA-OFT没有公开发布的预训练版本,只参与了从零训练条件的对比。结果令人印象深刻:在EBench上,预训练带来的提升幅度非常显著,π0从从零训练的11.2%成功率跃升到有预训练的24.4%,提升了13.2个百分点;π0.5从8.5%跃升到29.5%,提升了整整21个百分点;XVLA从15.7%升到24.7%,提升了9个百分点。

然而,在LIBERO平台上,预训练几乎没有带来任何差异——五个条件下的成绩全部集中在94%到98%之间,从零训练的π0甚至比有预训练的π0略高(95.7% vs 94.1%)。在RoboTwin 2.0的困难任务子集上,情况更加极端:从零训练的Fast-WAM拿到91.8%,从零训练的π0拿到88.8%,反而高于所有有预训练模型的58.4%到76.8%。这说明LIBERO和RoboTwin 2.0这两个平台的任务已经足够简单,以至于不需要预训练就能接近饱和,自然无法体现预训练的价值。EBench则是唯一一个在有无预训练条件下结果存在大幅且稳定差距的平台,因此也是唯一能真正衡量大规模预训练对通用策略贡献的评测工具。

十、镜头角度也会影响成绩:一个意外的发现

在附录研究中,研究团队还探索了一个有趣的工程问题:机器人上的主摄像头用哪个角度,会不会影响成绩?他们测试了两种配置:一种是架在工作区上方的俯视广角摄像头(Overview),另一种是安装在机器人头部、视野较小但聚焦于手部区域的近距头视摄像头(Headview)。

结果发现两款模型的偏好方向完全相反。π0在切换到头视摄像头后,测试成功率从24.44%升到26.92%,提高了2.48个百分点;π0.5则在切换后从29.53%降到25.32%,降低了4.21个百分点。进一步按任务类型拆分,π0对头视摄像头的偏好高度集中在精细操作任务上(差距达+8.38%),在移动任务上几乎没有差异(+0.28%)。π0.5对俯视摄像头的偏好则集中在移动和长时序任务上,因为这类任务的工作空间很大,俯视广角能更全面地覆盖整个移动范围。研究团队认为,这种差异的根源在于两款模型动作生成头(action head)的有效感受野不同,导致它们对"最合适的视野范围"有不同的偏好。不过这种摄像头带来的差异,在量级上比预训练带来的差异小了一个数量级,并不是左右成绩的决定性因素。

十一、五个"超纲题":当前所有模型都拿了零分

在任务层面的精细分析中,研究团队识别出了五个对当前所有模型都构成根本性挑战的任务:shop(超市购物场景的复杂操作)、bottle(瓶子相关操作)、peg_in_hole(经典的孔插销任务)、collect_coffee_beans(收集咖啡豆)和flip_cup_collect_cookies(翻转杯子并收集饼干)。所有四个模型在这五个任务上的成功率全部不超过5%,跨越多次评测时间点都是如此。

孔插销任务要求的精度极高,而翻转杯子再收集饼干则需要连续的力感知反馈——这两类任务都超出了当前开环动作模型(也就是一次性生成动作序列而不根据执行中途的反馈随时调整的模型)的能力边界。研究团队建议把这五个任务单独列为一个"硬核子集",供未来的模型开发者用作压力测试基准:任何模型如果能在这个子集上突破10%的成功率,就意味着在真正推动技术前沿。

十二、统计上的严谨:用置换检验揭开"假象"

研究团队在论文附录中还做了一项特别严谨的分析,专门防止"错误归因"的陷阱。当我们说某个模型在移动任务上比精细任务好,这个观察有没有可能只是因为恰巧移动任务里低精度任务更多,所以看起来移动比精细好,其实真正的原因是精度差异而不是移动/精细的本质区别?

为了排除这类混淆,团队使用了一种叫做置换检验的统计方法:将任务的标签在任务之间随机打乱10000次,每次计算打乱后两组之间的差距,形成一个"随机差距分布"。如果真实观察到的差距比99%的随机打乱结果都要大,那就说明这个差距确实可信,而不只是任务分组碰巧造成的。

分析结果显示,InternVLA-A1的移动优势是所有标签对比中统计可信度最高的(差距+30.9%,p=0.008)。π0.5在低精度任务上的优势(+37.1%,p=0.030)和在插入类任务上的劣势(–32.1%,p=0.040)也都通过了统计检验。相比之下,场景类别之间的差异大多没能通过检验,因为每个场景里任务数量太少(有的场景只有一到两个任务),这意味着"π0.5在卧室表现最好"这样的结论需要谨慎对待,背后很可能只是那个场景里恰好集中了低精度任务,而不是π0.5真的特别擅长卧室风格的视觉输入。

归根结底,EBench想要告诉机器人研究者的核心信息其实很朴素:一个综合分数像一张用人民币折叠出来的玫瑰,看起来挺好看,但展开来才能用。四款目前最先进的机器人大脑,在这套体检下呈现出了截然不同的能力图谱——没有任何一个是全科优等生,每一个都在某些科目上有明显的天花板,而这些天花板在综合总分里被平均掉了,变得隐形。这也正是EBench存在的理由:让这些隐形的短板变得可见,才能有的放矢地去修补它们。对普通人来说,这项研究意味着未来家里的服务机器人、工厂里的协作机器人,在被大规模部署之前,能够得到更全面、更准确的能力评估,减少"考试考得好但上岗之后露馅"的尴尬局面。对想要进一步了解这套评测方法的读者,可以通过arXiv编号2606.18239找到完整的论文和开源代码。

Q&A

Q1:EBench和LIBERO、RoboTwin这些已有的机器人评测平台有什么本质区别?

A:LIBERO和RoboTwin主要聚焦于单一类型的操控场景,而且任务已经相对饱和——就算不做任何预训练,从零训练的模型都能达到94%以上的成功率,根本无法分辨有没有预训练的差别。EBench的核心区别是同时覆盖了移动操控、长时序任务和精细操作三大类型,并且为每个任务打上五个维度的标签,让一个总成功率能被拆解成一张多维能力图谱,而不是一个无法诊断问题的单一数字。

Q2:InternVLA-A1综合成绩明明不是最差的,为什么说它在精细任务上"崩了"?

A:InternVLA-A1在移动操控任务上的成功率约34.7%,和最强的π0.5相当,但在需要毫米级精度的固定精细操作任务上成功率只有5.8%,两者之间差了整整29个百分点。这说明它的能力高度偏科:非常擅长大范围的导航决策,但在需要精细接触控制的场景里几乎失效。这种差距被综合总分平均掉了,但在EBench的分维度分析中就暴露得非常清楚。

Q3:EBench里那五个所有模型都接近零分的任务,为什么当前模型做不了?

A:孔插销这类高精度插入任务和翻转杯子收集饼干这类需要力感知反馈的任务,都要求机器人在执行过程中根据实时接触感知随时微调动作。但目前主流的通用模型采用的是开环方式,也就是一次性生成一段动作序列然后执行,中途不根据物体的实际反应来调整。这种设计在大多数任务上够用,但在需要持续力感知闭环的任务上就彻底失效了。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-