
你有没有想过这样一个问题:如果一个机器人试图把杯子挂到架子上,结果失败了,那这个失败和另一个"完全没伸手去够"的失败,是同一种失败吗?
按照现在大多数评测标准的做法,答案是:一样,都记作"0分"。
这就是机器人研究领域一直以来的尴尬现状。你去看任何一篇机器人操作论文,报告的核心数据几乎永远是一个词:成功率。这个任务做成了多少次,那个任务做成了多少次,百分比一列,排名一出,故事讲完。
但这套逻辑放在人类世界里试试看。假设你在评价两个实习生的工作表现,一个人把项目做到了99%然后在最后一步摔了跟头,另一个人从第一天开始就完全没找到工作方向。你会说"他们俩都是零分,一样差"吗?显然不会。你会想知道过程中发生了什么,谁更接近成功,谁的问题更根本。
机器人评测长期以来恰恰忽略了这件事。这篇论文的团队看不下去了,他们提出了一套叫做 PRM-as-a-Judge 1.5 的工具包,试图把"是否成功"这种粗暴的二元判断,变成一份详细的"体检报告"。
这件事到底难在哪:从"打分"到"读懂过程"
先说清楚背景。目前主流的机器人评测方法大致分三类。
第一类是最简单粗暴的二元成功率,也就是前面提到的"成功/失败"打标签。这种方法覆盖了几乎所有主流机器人测试基准,比如CALVIN、LIBERO这些业内熟知的评测集。问题很明显:一次干净利落的成功和一次靠反复试错、连滚带爬才勉强完成的成功,得分完全一样。
第二类是人工设计规则打分,比如给任务拆解成几个阶段,每个阶段人为设定权重和阈值。这确实比二元标签精细一些,但代价是每个任务都得重新设计一套规则,人力成本高得离谱,而且不同人打的分可能还不一致。
第三类是利用环境里的"内部状态"数据,比如物体的精确坐标、关节角度这些只有仿真环境或者特殊传感器才能拿到的信息。这类方法能给出很详细的诊断,但一旦机器人跑到真实世界、换了个任务场景,这套评测逻辑就得推倒重来,因为它太依赖那些"内部特权信息"了。
三条路都走不通,或者说都只能走一半。这篇论文的团队于是提出了第四条路:只用一样东西——机器人执行任务时录下来的视频,再配上任务的文字描述,就能自动生成一整套细致的评估指标,不需要偷看仿真器里的坐标,也不需要人工规则。
这个思路的关键工具叫做 PRM
*PRM(Process Reward Model,过程奖励模型):一种能够根据机器人执行任务的画面,逐帧或逐段判断"任务完成到什么程度了"的模型,输出的是一条连续的进度曲线,而不是一个孤零零的成功/失败标签。*
PRM把一段视频"翻译"成一条随时间变化的进度曲线,曲线的高低起伏,就藏着这次任务执行的全部秘密:机器人在哪里犹豫了、在哪里退步了、有没有从退步里缓过来、最后到底冲到了多高的完成度。
这就好比给病人做体检,过去的做法是只问一句"你健康吗",回答只有"是"或"否"。现在换成了连续心电图监测,你能看到心跳在每一秒钟的波动,哪里有异常起伏,哪里恢复正常。如果不做这种连续监测,医生只能凭病人一句"我没事"来判断,那些潜在的问题,比如某段时间心率异常但很快自愈,根本无从发现。同样的道理,如果机器人评测只看最后的成功与否,那些"差一点就成功了"和"努力挣扎后恢复正常"的过程细节,全都会消失在那个孤零零的0或1里。
核心方法:OPD三层指标体系
PRM-as-a-Judge 1.5 建立在一套叫做 OPD 的指标框架上,这是这篇论文体系的骨架,值得仔细拆开看。
*OPD(Outcome-Process-Diagnosis,结果-过程-诊断):把机器人执行任务的评估拆成三个层次,分别回答"走到哪了"、"走得顺不顺"、"哪里出了问题"这三个不同维度的问题。*
先看结果层(Outcome)。这一层关心的问题很朴素:这次任务,机器人最终走到了哪一步?这里有两个核心指标。
第一个是里程碑覆盖率(Milestone Coverage,简称MC@q),意思是统计有多少比例的执行轨迹,达到了某个进度百分比的门槛,比如25%、50%、75%。第二个是最大进度(Max Progress,简称MP),就是整段执行过程里,进度曲线到达过的最高点。
这两个指标合起来能回答一个问题:机器人普遍卡在哪个阶段?如果大部分轨迹的MC@25很高但MC@75很低,说明机器人擅长起步,但越往后越吃力。
再看过程层(Process)。这一层只有一个指标,叫路径加权进度长度(Path-weighted Progress Length,简称PPL),公式是最大进度的平方除以整条曲线的总变化量。
这个指标想衡量的是"效率"。同样达到了80%的进度,一条曲线是笔直上升的,另一条曲线是上蹿下跳、来回折腾了好几次才爬到80%,这两种执行方式显然质量不一样。PPL就是用来区分这两种情况的。
打个比方,你从家走到公司,直线距离两公里。有人骑车直接到,骑行里程正好两公里。另一个人绕了一大圈,走走停停,骑了六公里才到。终点一样,但过程效率天差地别。如果不追踪整条路径只看终点,你根本发现不了后者其实浪费了两倍以上的体力和时间,这正是只用成功率评测的盲区。
最后是诊断层(Diagnosis),这是整个体系里最丰富、也是这篇论文重点扩展的部分。诊断层原本在1.0版本里有两个指标:累积遗憾面积(Cumulative Regret Area,简称CRA)和停滞比率(Stagnation Ratio,简称STR)。
CRA衡量的是,曲线在每个时间点,相比之前达到过的最高点,落后了多少,然后把这些落后累积起来求平均。这个数字越大,说明机器人退步得越严重、退步持续得越久。STR则是统计执行过程里,有多少比例的时间步,进度几乎没有任何变化,也就是卡壳、犹豫、原地打转的比例。
这两个指标已经能捕捉不少细节了,但这篇论文的团队觉得还不够,于是在1.5版本里新增了三个"条件化"指标,这也是整篇论文最核心的贡献。
三个新指标:把失败、恢复、成功都拆开看
第一个新指标叫失败近成功度(Failure Near-Success,简称FNS),专门针对那些最终失败的执行轨迹。
它的计算公式是:0.5倍的最大进度,加上0.3倍的MC@75,再加上0.2倍的MC@50。这个加权组合的意思是,一次失败,如果它在失败之前已经冲到了75%的进度,那这次失败的"含金量"要远高于那种从头到尾都没进展的失败。
论文里给出了一个特别直观的案例。在"给充电器插插头"这个任务里,π0.5模型的一次失败轨迹,FNS得分高达99.5,而π0模型的一次失败,FNS只有2.7分。看曲线你会发现,π0.5已经成功抓起了插头,只是最后没插进去,而π0则是反反复复连插头都没抓稳。两次都叫"失败",但信息量完全不对等。
这就像两次考试都没及格,一个学生答对了所有大题只在最后一道小题算错答案,另一个学生连题目都没读完。传统的"不及格"标签会把这两个人混为一谈,而FNS这种指标,相当于给不及格的卷子也打了个详细批注,告诉你这份卷子其实已经很接近及格线了。
第二个新指标是回撤恢复比率(Drawdown Recovery Ratio,简称DRR),这个指标专门针对那些执行过程中出现过"回撤"(也就是进度突然下滑)的轨迹。
它的算法是:找到整条曲线里降幅最大的那个坑,也就是"最大回撤点",然后看这个坑之后,曲线最多能反弹回多高。反弹高度除以坑的深度,就是DRR。如果完全弥补回来了,DRR就是1,也就是满分。
论文里有个很有意思的对比案例,是"把杯子挂到架子上"这个任务。π0.5这个模型,进度曲线先是掉到了接近零,但后来硬是恢复过来并且超越了掉坑之前的水平,DRR算出来是满分1.0。而Xiaomi-Robotics-0这个模型,同样也遭遇了大幅度的进度回撤,但直到任务结束都没能缓过来,DRR几乎是0。
这就好比投资,两个人的账户都遭遇过一次大跌,一个人扛住了后来市场回暖时账户不仅回本还赚了,另一个人从此一蹶不振,账户余额再没恢复。仅仅看"跌过一次"这个事实,你没法区分这两种截然不同的人生走向,只有看后续走势才知道谁真正扛过来了。如果不设计这样一个专门衡量"恢复力"的指标,那些经历过挫折但最终韧性十足的模型,和那些一蹶不振的模型,会被同样归为"有过失误"这一类,完全丢失了区分度。
第三个新指标叫成功质量分数(Success Quality Score,简称SQS),针对的是那些最终成功的轨迹,毕竟"成功"这个词本身,也掩盖了太多细节差异。
SQS的公式是:0.5倍的PPL,加上0.3倍的(1减CRA),再加上0.2倍的(1减STR)。简单说,就是综合考察这次成功执行得有多顺畅、有多稳定、有没有反复卡顿。
论文举了"把瓶子立起来"这个任务的例子。InternVLA-A1这个模型最终成功了,SQS高达97.9分,进度曲线基本是持续攀升,过程干净利落。π0.5这个模型也成功了,但SQS只有76.2分,曲线里有明显的挫折和反复,虽然最后也完成了任务,但过程磕磕绊绊。
这有点像两个人都通过了驾照考试,一个人一把过、动作流畅,另一个人挂了两次科目二、中途还压线扣分,最后压线级低分通过。结果一样都是"拿到驾照",但这两个人真正的驾驶熟练度显然不能划等号。要是不设计SQS这样的指标,所有成功案例都会被贴上同一个"合格"标签,这份差异就永远浮不出水面。
这三个新指标合在一起,构成了这篇论文对旧版OPD体系的核心升级。它们分别盯住了三类不同的执行状态:失败但接近成功、经历回撤后能否恢复、成功但质量高低不一。
拿真实数据说话:给一堆机器人模型做"全身体检"
光有指标框架还不够,这篇论文接着拿这套工具,对当前主流的具身智能模型做了一次大规模的实际评测。
评测用的基准叫做 RoboDojo
*RoboDojo:一个同时覆盖真实世界任务和仿真环境任务的机器人操作评测基准,其中真实世界部分侧重考察高难度的实际部署能力,仿真部分则考察泛化能力、记忆能力、长时程任务表现和指令遵循能力。*
论文团队没有对任何模型做微调或者修改,完全是拿各家公开发布的执行录像来跑评测,评测对象覆盖了当前一大批叫得上名字的具身模型,比如π0、π0.5、GR00T-N1.7、X-VLA、GalaxeaVLA等等。这些模型可以粗分为两大类:
*VLA(Vision-Language-Action model,视觉-语言-动作模型):一种直接把摄像头看到的画面和语言指令,映射成机器人动作指令的模型架构,是目前具身智能领域最主流的技术路线之一。*
*WAM(World Action Model,世界动作模型):一种先建立对物理世界如何演变的内部模拟,再据此规划动作的模型架构,和VLA走的是不同的技术路子。*
评测跑完之后,论文得出了五个挺有意思的发现,每一个都值得说道说道。
第一个发现是,VLA整体上比WAM更强。团队统计了在RoboDojo-Sim这个仿真基准的前三名、前五名、前十名里,VLA和WAM各自的占比。结果前三名里VLA占了27%(而WAM是0%),前十名里VLA占了64%(WAM是60%)。虽然差距在前十名这个更宽泛的圈子里有所收窄,但在最顶尖的几个位置,VLA是完全压制WAM的。
第二个发现有点反直觉:模型越大不代表越强。论文画了一张模型参数量和综合排名的散点图,结果发现四块区域里都有模型分布,包括那种参数量偏小但排名却很靠前的模型,也包括参数量很大但排名反而靠后的模型。比如X-VLA只有0.9B参数,却排在相对靠前的位置,而Spirit v1.5用了5B参数,排名却垫底。
这个发现其实值得琢磨一下。我们平时默认的直觉是,模型越大、参数越多,能力自然越强,这在语言模型领域某种程度上确实成立,大模型的涌现能力已经是共识。但机器人操作这件事似乎不完全遵循这个规律,可能是因为机器人任务对精细的动作控制、实时反应的要求,和纯语言理解能力关系没那么直接,堆参数量堆不出来的东西,可能得靠更精巧的架构设计或者更高质量的训练数据来补。
第三个发现是,综合来看π0.5这个模型表现最稳,在几乎所有指标上都排在前列,是目前公认的"优等生"。
第四个发现关于任务类型难度分布。论文把任务分成四类:泛化任务、精确操作任务、长时程任务、开放词汇任务。结果显示,精确操作任务是当前模型表现最好的一类,长时程任务和泛化任务次之,而开放词汇任务是公认的老大难,所有模型在这类任务上的得分都低,而且扎堆聚集在低分区间。
这个发现说明什么?说明当指令变得不那么严格限定(比如让模型自己理解一个描述模糊的物体名称,而不是给定死板的指令),现有模型的适应能力还很脆弱。这倒是和大语言模型领域"开放式任务比封闭式任务更难"的规律有点像,只不过机器人领域这个差距体现得更加悬殊。
值得一提的是,长时程任务的模型间表现差异是四类任务里最大的,这意味着如果你想设计一个测试来"拉开"不同模型之间的差距,长时程任务是个特别好用的试金石。
第五个发现,可能是最让人意外的一个:仿真环境的表现,不能很好地代表真实世界的表现。
论文找了9个在仿真基准和真实世界基准都跑过的模型,对比它们在两边的排名。结果显示三个不同指标(成功率、最大进度、失败近成功度)的斯皮尔曼相关系数,分别只有0.58、0.18和0.22。这意味着什么?意味着一个模型在仿真里排第一,不代表它在真实世界也排第一,相关性弱到几乎可以说是两码事。
这个发现背后还有更细的分析。论文比较了6个仿真和真实世界都存在的共同任务,发现表现差距和任务的物理特性密切相关。像"把笔筒填满"这种空间容差比较大、接触方式比较简单的任务,真实世界表现甚至比仿真里还好一点点。而像"给杯子挂钩"、"给试管分类插入"、"给物体分类摆放"这种需要精确对齐、涉及复杂接触力学的任务,真实世界的表现比仿真里普遍差了20到50个百分点不等。
这个对比让我想起一个道理:在游泳池里学会的换气技巧,拿到真实的海里去用,可能完全不管用,因为海浪的复杂程度、水流的不确定性,是泳池里那种平静水面完全模拟不出来的。如果一个模型在仿真里训练得再好,一旦遇到真实世界里那些复杂的物理接触细节,比如摩擦力、材质弹性这些微妙的变量,仿真环境里被简化掉的那部分现实,恰好就是压垮模型的最后一根稻草。
RoboPulse++:给"裁判"本身也做个考试
前面说的所有指标,都建立在一个前提上:PRM本身给出的进度曲线是准的。但如果这个"裁判"自己判断得不准,那后面所有的精细分析都是空中楼阁。
所以这篇论文专门做了一件事,搞了一个叫 RoboPulse++ 的测试集,专门用来考核各种PRM到底靠不靠谱。
这个测试集的设计思路挺聪明的。它没有让人工去给每一帧标一个"完成了百分之几"这种绝对数值,原因是不同任务之间根本没有统一的度量标准,你没法说"拧螺丝的50%进度"和"叠衣服的50%进度"是同一个概念。
于是团队换了个思路,只标注一个区间的进度方向:这段执行是在"上升"(Rising,朝着任务目标靠近),还是在"下降"(Falling,朝着任务目标偏离)。这个二元判断,比绝对数值容易达成一致得多。
整个数据集包含700段机器人执行轨迹,涵盖275个具体任务条目,总共17052帧画面,由人工标注出2244个带方向标签的区间。数据来源既有真实世界录像也有仿真环境录像,覆盖抓取、放置、推拉、开关柜门、物体分类堆叠等各种操作类型。
有了这套考题,团队接着拿市面上各种"裁判模型"来考试,既包括专门为机器人评测设计的PRM,比如Robo-Dopamine、RoboMeter,也包括通用的大语言模型,比如GPT-5.4、Gemini 3.1 Pro、Qwen 3.6 Plus、Claude Sonnet 4.6。
结果显示,专门设计的PRM整体上明显强于通用大模型客串裁判。表现最好的是Robo-Dopamine的"前向"模式,综合准确率达到84%,而表现最好的通用大模型设置(Gemini 3.1 Pro配对式判断)综合准确率只有63%,差了整整21个百分点。
但更有意思的发现藏在细节里:所有裁判模型,不管是专用的还是通用的,识别"下降"(Falling)的能力都明显弱于识别"上升"(Rising)。最好的模型在识别上升趋势时F1分数能到0.92,但在识别下降趋势时,最好的成绩也只有0.63。
这说明什么?说明现有的模型普遍有个共同的盲点,擅长看出"事情在变好",却很难精准捕捉"事情正在变糟"。团队进一步分析了155个被标注为"下降"的区间样本,发现失败原因绝大多数(78.1%)属于"交互关系失败",也就是机器人和物体的物理接触出了问题,比如抓着的东西掉了,或者没能精准放到目标位置。剩下21.9%属于"任务顺序失败",比如做事情的先后顺序搞反了。
这个发现其实挺深刻的。它说明当前的具身模型评判系统,在理解"高层任务逻辑"上问题不算大,但在判断"精细的物理交互是否真的按预期发生"这件事上,还差得很远。这某种程度上也印证了前面那个仿真和真实世界表现脱节的发现,两者背后可能是同一个根源:物理世界的精细交互,永远是最难捕捉、最容易被忽略的部分。
论文还专门比较了配对式判断(Pair Style,只看相邻两帧)和序列式判断(Sequence Style,看一整段有序帧)这两种裁判工作方式的差异,针对那种"需要结合历史上下文才能判断"的特殊场景(比如机器人先完成了一个子目标,后来又把它撤销了)。结果显示,序列式的RoboMeter准确率达到94%,而只看相邻两帧的Robo-Dopamine准确率只有74.6%,尤其在识别"下降"这类情况时差距更悬殊(90.1%对40.8%)。
这个结果很符合直觉。如果你只看两张连续的照片,却不知道这个人五分钟前刚经历了什么,你很难判断眼前这个瞬间到底是进步还是倒退。就像你去评价一个人今天的心情,只看他此刻的表情,和结合他今天整天的经历一起看,得出的判断可能完全不同。如果只依赖局部片段做判断,那些需要"记住之前发生过什么"才能识别的退步,永远会被漏掉,这正是为什么序列式的裁判在这类场景里明显更胜一筹。
效率也得算账:跑一次评测要花多少钱
评测系统再精细,如果贵得离谱、慢得离谱,也没法大规模推广。论文专门做了一个效率对比,拿几种代表性PRM,在同一台H100显卡上跑同样100段视频,记录了显存占用和运行时间。
结果显示,不同PRM之间的资源消耗差异非常大。RoboMeter这个模型只需要12GiB显存,跑完100段视频只花了46秒。而PRIMO这个带思维链推理的模型,虽然效果不错,但跑完同样的任务花了19.6个小时,足足慢了1500多倍。
这个巨大的效率鸿沟提醒我们一件事:一套评测工具再精细,如果慢到没法大规模使用,那些精妙的指标设计也只能停留在小规模实验里。好在论文里也提到,批量推理能大幅提升效率,比如把Robo-Dopamine-4B模型的处理速度,从单条处理的29.3分钟压缩到批量处理下的7.8分钟,提速接近4倍。
曲线到底靠不靠谱:能不能反推出传统成功率
这篇论文还做了一件挺讲究的验证工作:既然这套系统抛弃了传统的二元成功率,转而用连续进度曲线来做精细分析,那这条曲线本身,是不是还保留了原来那个成功率信息?
团队的验证方法是:把进度曲线上是否达到过100%进度,当作"是否成功"的替代判断标准,然后拿这个PRM推算出来的成功率,去和RoboDojo官方公布的成功率做对比。
结果显示,两者的平均绝对误差在仿真环境里只有1.57个百分点,在真实世界里只有1.32个百分点,而且排名的一致性(斯皮尔曼相关系数)分别达到0.88和0.96,相关性相当高。
这个验证工作的意义在于告诉大家:这套新系统不是在丢掉旧信息,而是在旧信息之上叠加了更丰富的层次。它既能推算出和传统成功率几乎一致的结果,又额外提供了传统方法完全给不出的细节洞察。这就好比升级了体检设备,新设备不仅能测出你原来体检报告里那几项基础指标(而且测得同样准),还能顺带告诉你血压在一天里的波动曲线,这是老设备完全做不到的。
写在后面
读完这篇论文,最让我意外的其实是那个"仿真和真实世界相关性只有0.18到0.58"的数字。这个数字比我预想的低得多。业内长期以来默认一个假设:仿真环境是真实世界的"预演场",在仿真里表现好的模型,大概率也能在现实里表现不错。这篇论文用扎实的数据把这个假设打了个问号,而且给出了具体原因:问题恰恰出在那些最需要精细物理交互的任务上。
另一个让我反复琢磨的细节是,所有裁判模型都在识别"进度下降"这件事上普遍吃力,而且原因高度集中在"物体交互失败"这一类,而不是"任务逻辑理解错误"。这说明当前具身智能领域面临的瓶颈,可能不在"理解任务该怎么做"这个认知层面,而在"精确执行物理接触"这个更底层、更难被语言模型直接建模的层面。这个发现或许比论文的整套评测指标本身,更值得整个行业停下来想一想。
值得追问的是:如果连接触失败都识别不准,那些真正建立在触觉、力反馈基础上的评测方式,会不会才是下一步真正该走的方向?
Q&A
Q1:PRM-as-a-Judge 1.5是什么?
A:它是一套机器人过程评估工具包,能把机器人执行任务的录像转换成连续的进度曲线,并计算出多种细致指标,取代传统的"成功/失败"二元判断,让人能看清机器人在执行过程中的具体表现,包括哪里退步、能否恢复、成功执行得是否高效。
Q2:为什么不能只看机器人任务的成功率?
A:因为成功率会掩盖大量信息。两次都失败的执行,可能一次已经接近完成,另一次从头到尾都没进展;两次都成功的执行,过程可能一个干净利落,另一个反复出错才勉强完成。只看成功与否,这些差异全部消失,不利于真正理解模型能力。
Q3:仿真环境测试出的机器人表现,能代表真实世界的表现吗?
A:不太能。论文对比了9个同时在仿真和真实世界测过的模型,发现两边排名的相关性只有0.18到0.58,相关性偏弱。尤其在需要精确对齐、复杂物理接触的任务上,真实世界表现比仿真差了20到50个百分点,差距相当明显。
好文章,需要你的鼓励
这篇论文提出一种插件式2D动作接口,让已训练好的3D运动语言模型无需修改或微调即可直接理解2D姿态输入。实验证明2D输入效果媲美3D输入,且在真实视频场景下配合专门的降噪适配器,2D方案比3D姿态估计更省算力、更实用,为动作理解模型的现实部署提供了新路径。
研究团队让8种AI智能体独立完成100项真实科研任务,深度剖析800份研究轨迹后发现,即便是最强模型,也普遍存在"发现问题却不修正"的现象,背后根源指向AI缺乏检验自身产出、主动纠错的元认知能力。
WorldRover是一套面向可探索世界建模的合成视频数据引擎,基于虚幻引擎构建,能让同一段探索轨迹在保持路线与场景一致的前提下,重新渲染为多种视角和外观状态,并同步提供深度、光流、长程点追踪等丰富标注,最终发布WorldRover-10M数据集,含2190万帧、202.7小时视频。
这篇论文指出,现有多目标强化学习训练大模型时存在"一刀切"分配优化精力的问题,提出SA-MRPO方法,根据每个奖励目标的饱和程度动态调整其权重,在数学推理、自适应推理、代码生成等任务上均取得优于现有方法GDPO的效果。