微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 香港科技大学联合研究团队揭秘:当机器人的"眼睛"遭遇现实世界的光影考验

香港科技大学联合研究团队揭秘:当机器人的"眼睛"遭遇现实世界的光影考验

2026-06-05 09:17
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-06-05 09:17 科技行者

这项由香港科技大学(广州)、香港科技大学与科技公司Knowin联合开展的研究,以预印本形式于2026年5月30日发布,论文编号为arXiv:2606.00828。研究的核心成果是一个名为RoboStressBench的测评框架,专门用于诊断视觉语言模型在真实物理场景中的感知可靠性。

一、机器人的眼睛并不像我们想象的那么可靠

现代AI视觉系统,尤其是那些被称为"视觉语言模型"的技术,已经能够在照片里认出各种物体、理解场景、回答复杂问题。从某种程度上说,它们的"视力"相当惊人。然而,当这些系统被装进真实的机器人身上,进入真实的厨房、仓库或医院时,麻烦就来了。

以一个具体场景为例:一台服务机器人需要从桌上拿起一个玻璃杯。在实验室里,白色背景、均匀灯光、玻璃杯摆正,一切井井有条,AI识别得毫无压力。但在真实环境里,这个玻璃杯可能是透明的,背景透过它显露出来;窗边的阳光可能在杯壁上留下一道刺眼的高光;也许桌上还有一堆其他杂物把杯子大半遮住。就在这时,曾经表现优异的AI视觉系统开始犯糊涂——它可能认错目标,可能找不到杯子,甚至可能给出一个错误的抓取位置。

这种由真实物理世界的光影、材质、角度和空间关系所造成的视觉困扰,研究团队将其称为"物理视觉压力"。本质上,这是因为现实世界的光线是按照物理规律运作的——光打在不同材质的表面会产生完全不同的效果,从不同角度看同一个物体形状会大相径庭,强烈的阴影或过曝的高光会把细节完全淹没。

正因如此,这支研究团队开始思考一个关键问题:我们是否真正评估过AI视觉系统在这些物理困扰下的真实能力?答案令人警醒——现有的测试方法并没有做到这一点。

二、现有测试方式存在的盲区

要理解为什么现有评测方式不够用,可以用考驾照来类比。现有的AI视觉测评,大致分成两类。第一类像是在模拟驾驶室里考试:图片干净整洁,场景理想化,考的是基本能力,不考现实路况。这类测试能衡量AI的通用理解能力,但对于真实部署帮助有限,因为现实世界里很少有这么完美的条件。

第二类更接近实战,但采用的方式有些奇怪:它们给图片加上"数字噪声"——比如随机像素点、人工模糊、马赛克格子——然后测试AI能否应对。这就好比考驾照时不是在真实雨天路面上练习,而是让考生戴上一副磨砂眼镜来模拟视线不清。磨砂眼镜确实会让视线模糊,但这和真实雨天驾驶完全不是一回事。更关键的是,现实世界里几乎不会出现"随机像素噪点"这种干扰,但透明玻璃、强烈反光、复杂纹理背景、拥挤堆叠的物品,这些问题每天都在发生。

RoboStressBench的出发点,正是填补这个空白——用真实物理世界中真实发生的视觉困扰,来测试AI视觉系统的真实可靠性。

三、从物理光学出发,建立一套有章可循的困扰分类体系

研究团队没有随意拼凑一堆"困难图片",而是从物理学的角度,系统性地思考:一张图片的最终样貌,究竟是由哪些物理因素决定的?

在物理学中,有一个描述光线如何在场景中传播并最终被相机捕捉的经典方程——渲染方程。这个方程告诉我们,一个物体在图像中的样子,取决于四个核心因素:它表面的材质特性(Material,简称M),观察它的角度和位置(Viewpoint,简称V),照亮它的光线条件(Lighting,简称L),以及它在空间中的几何结构和与周围物体的关系(Geometry,简称G)。研究团队将图像的形成简洁地表达为一个公式:I = F(M, V, L, G)。

这四个因素,恰好对应了现实世界中最常见的四类视觉困扰。在材质层面,研究团队定义了五种压力类型。"深色吸光"是指物体表面吸收了大部分光线,几乎看不清细节,就像试图在夜晚辨认一件全黑的衬衫。"低对比融合"是指目标物体的颜色、纹理或亮度与背景极为相似,二者几乎融为一体,就像穿着迷彩服的士兵趴在草丛里,很难一眼找到。"复杂纹理"是指目标物体所在的表面有密集的花纹或图案,这些纹理会干扰AI的识别,就像在一张花哨的印花桌布上找一张同款花纹的杯垫。"透明材质"是指物体本身是透明或半透明的,背景透过它显现出来,改变了它应有的外观,玻璃杯、塑料袋都是典型例子。"镜面混淆"是指高度光滑或镜面状的表面产生了强烈反光,把其他物体的影像投射进来,制造视觉上的假线索,比如不锈钢锅底倒映出整个厨房。

在视角层面,研究团队定义了三种压力类型。"极端视角"是指以俯视、仰视或极度侧面的角度观察物体,让它偏离了通常出现在训练数据中的"标准模样"。"截断出框"是指目标物体部分延伸到了图像边界之外,只有一部分被拍摄进来,就像只看到一个人的半条腿。"小尺寸目标"是指目标物体在画面中占据的面积极小,成为一个细小的点,难以识别和定位。

在光照层面,研究团队定义了四种压力类型。"全局过曝"是指整个场景光线太强,大量细节被白光淹没,就像晴天正午对着天空拍照。"局部过曝"是指场景中某个局部区域有强烈的高光或眩光,遮盖了该区域的细节,常见于窗边强光或灯具直射。"全局欠曝"是指整个场景太暗,难以看清任何细节,就像光线极弱的地下室环境。"局部欠曝"是指场景中某个局部区域处于阴影中,该区域的信息难以获取。

在几何结构层面,研究团队定义了四种压力类型。"遮挡"是指目标物体被其他物体部分遮住,常见于杂乱环境中。"非刚性形变"是指物体因弯曲、折叠、压缩等发生了形状变化,例如一个被压扁的纸箱或卷起来的毛巾。"堆叠布局"是指多个物体垂直叠放,物体之间的支撑关系变得模糊,比如叠放的书本或碗碟。"拥挤布局"是指大量物体密集排列,场景杂乱,使得分割单个目标和理解空间关系变得非常困难。

这套分类体系的优雅之处在于,它不是凭感觉拼凑的,而是从物理成像原理自然推导出来的。每一种困扰背后,都有真实的物理原因,研究者可以追溯到底是哪个物理因素让AI系统出了问题。

四、一个横跨三条来源、包含七千余个样本的测试集是怎样炼成的

有了分类框架,接下来的挑战是:如何收集足够多样、真实且可控的测试数据?研究团队采用了三条互补的路径。

第一条路径是从现有的公开学术数据集中"淘金"。研究团队从EmbSpatial-Bench、RefSpatial-Bench、RoboAfford-Eval、RoboSpatial-Home、ManipulationVQA等多个已有数据集中,人工筛选出那些天然就包含物理视觉压力的图片。六名经过专业培训的标注人员,逐一检查这些图片,为每张图片打上材质、视角、光照、几何四个维度的压力标签,并核实原有的问题和答案是否仍然适用。

第二条路径是"人工制造"压力场景。对于某些在现实中确实罕见、难以自然采集的压力类型,研究团队采用了图像编辑技术,从"正常"的图片出发,合成出带有特定压力的版本。编辑工具采用了Gemini-3-Pro-Image和Qwen-Image-Edit,但用法非常克制——每次编辑都有严格的指令,只允许改变一个特定的物理因素,必须保留场景中其他所有内容。论文中展示了几种典型的合成方式。一种是"边界框引导保留":先在图上画一个临时的红色矩形框,框住需要保护的目标区域,告诉编辑工具"框内的物体和位置不能动,在框外添加一些杂物让桌面更凌乱",编辑完成后再删除红框,得到一张看起来自然的图片。另一种是"纯语言描述编辑":直接用文字指令告诉编辑工具"在桌子左侧添加一块皱巴巴的白色布料,保持其他所有物体的位置、相机角度和光线不变,结果要看起来像真实照片"。还有一种是"外观因素编辑":通过改变光照或材质来引入压力,比如指示工具"从右上方增强光线,在前景表面创建一个明亮的局部过曝区域,保持整体场景结构尽可能不变"。

第三条路径是主动收集真实世界图片。研究团队一方面从Pexels等图库网站获取真实场景照片,另一方面在各种物理环境中自行拍摄,专门寻找那些包含自然发生的视觉压力的场景。

最终,整个数据集包含7183个样本,其中2927个来自现有数据集筛选,2596个通过合成生成,1660个来自现实采集。由于现实中多种视觉压力往往同时出现,数据集支持多标签标注,一张图片可以同时被标记为"遮挡"和"拥挤布局",但会记录一个"主导压力维度"用于分析。

测试任务涵盖了视觉问答(选择题)和空间定位两大类。视觉问答分为三种:需要空间推理的问题(比如"哪个物体距离你最近?")、需要理解物体状态的问题(比如"机器人抓握是否稳固?")、以及需要高层规划的问题(比如"机器人下一步应该移向哪个方向?")。空间定位分为两种:目标定位(找到特定物体,输出边界框坐标)和放置点定位(找到适合放置物体的空白区域,输出坐标点)。所有坐标都被归一化到0到1000的范围,方便不同分辨率图片的统一评估。

五、十六个顶尖AI视觉系统接受体检,结果令人深思

研究团队用这个测试集,对当前最先进的十六个视觉语言模型进行了全面评测,涵盖五大模型家族:阿里巴巴旗下的Qwen3-VL(三个规模版本)、Qwen3.5(四个规模版本)、Qwen3.6(两个规模版本),腾讯的InternVL3.5(三个规模版本),Allen AI的Molmo2(两个规模版本),以及谷歌的Gemini-3.1和OpenAI的GPT-5.5。

第一个令人印象深刻的发现是:所有模型的表现都离"满分"相去甚远。在整体准确率上,表现最好的模型Qwen3.5-35B-A3B只达到了58.1%,也就是说大约有四成的题目它答不对。更令人意外的是,大家熟悉的商业顶级模型Gemini-3.1和GPT-5.5分别只有44.8%和46.2%。这并不是说这些模型能力差,而是说物理视觉压力对它们的影响确实很大——同样的场景和问题,换一张正常图片它们都能答对,但换成带有物理压力的图片后,错误率大幅上升。论文中的对比数据尤为直观:在一组配对的"正常版/压力版"图片测试中,Qwen3.6家族的模型在正常图片上准确率高达64.3%,但换成压力版图片后骤降到40.1%,足足下降了24.1个百分点。

第二个重要发现是:模型越大并不意味着压力适应能力越强。在同一个模型家族内,参数规模更大的版本确实在平均分上有所提升——比如Qwen3.5从4B版本的49.8%提升到27B版本的58.1%,增长了8.3个百分点。但在某些特定的压力类型上,大模型并没有比小模型表现出明显优势。更耐人寻味的是,InternVL3.5的14B版本在总体准确率上甚至不如同家族的4B版本。这说明,应对物理视觉压力需要的不只是更多参数,可能需要专门的能力培养。

第三个也是最深刻的发现是:不同的视觉压力会精准地击中AI系统的不同弱点,而这些弱点在总体分数上完全看不出来。具体来说,几何压力(遮挡、拥挤布局、堆叠)对定位类任务的破坏力最强——无论是找目标物体的位置还是找放置点,几何压力都让模型的准确率跌至最低。这背后的道理并不难理解:当目标被遮住或被大量其他物体包围时,模型需要进行精细的空间分析,而这恰恰是几何压力直接攻击的能力。

然而,对于高层规划类问题(比如"机器人下一步该怎么做?"),几何压力反而不是最致命的,材质压力和视角压力对规划能力的破坏更为显著。对于理解物体状态的问题(比如"抓握是否稳固?"),光照压力对部分模型的伤害尤为突出。这意味着,一个在总体分数上表现相近的AI系统,实际上可能在某些特定任务下极其脆弱——而这种脆弱性,只有通过细分的压力分析才能暴露出来。

六、一个不需要重新训练模型的临时解决方案

面对这些发现,研究团队进一步提出了一个名为StressDART的测试时干预框架。StressDART的名字来自"检测与修正"(Detection And Rectification at Test time)的缩写,核心思想是:与其等待模型在压力下自己挣扎,不如在它"看图"之前,先诊断出图片里有什么视觉困扰,然后针对性地把图片修正一下,再让模型去回答问题。

整个流程分三步走。第一步,用一个"压力探测器"分析输入图片,判断它主要属于材质、视角、光照、几何哪个压力维度,并给出更细的压力类型标签,比如"全局欠曝"或"遮挡"。这个探测器本身也是一个视觉语言模型,使用的是Qwen3-VL-4B。第二步,根据诊断出的压力类型,选择对应的视觉修正操作——欠曝的图片就增强亮度,过曝的就做高光恢复,小目标就裁剪放大,而对于那些无法安全修正的压力(比如遮挡,你没法凭空"去掉"遮挡物),就保留原图不做修改。修正操作由Qwen-Image-Edit工具执行。第三步,把原始图片和修正后的图片一起交给最终的推理模型,让它综合两张图片的信息来回答问题。同时提供原图的目的是:有时候图像编辑会轻微改变一些细节,原图可以作为参照,防止模型被错误的修正结果误导。

实验结果显示,这个方案确实有效。以Qwen3-VL-4B为基准,不使用StressDART时整体准确率为43.2%;只用修正后的图片,准确率提升到48.9%;同时提供原图和修正图,准确率进一步达到49.0%。虽然提升幅度不是天翻地覆,但考虑到整个过程完全不需要修改模型的任何参数,也不需要重新训练,这个增益来得相当"廉价"。更重要的意义在于,它验证了"先诊断、再修正"这个思路的可行性,为未来更精细的测试时干预方案提供了方向。

不过,研究团队也坦诚地指出了这个方案目前的局限性:图像编辑有时会引入新的不确定性,比如改变了一些任务关键的视觉细节;压力诊断有时会出现误判,把图片归入错误的压力类别。这两个问题都需要未来的工作去解决。

七、这项研究还有哪些没有触及的边界

研究团队在论文中明确地列出了RoboStressBench目前存在的几条局限。首先,材质-视角-光照-几何这四个维度虽然来自物理成像原理,但并不意味着它们能穷举现实中所有可能的视觉困扰。此外,这四个维度在现实中也不是完全独立的——视角和几何之间、光照和材质之间都可能相互纠缠,这给细粒度的失败归因带来了挑战。

其次,尽管合成数据经过了严格的人工验证,但计算机生成的图像和真实拍摄的图像之间存在微妙差异,某些合成样本可能无法完全复现真实物理压力的视觉效果。

第三,目前的评测任务局限于静态图片上的视觉问答和空间定位,没有覆盖动态视频、多视角输入、或者真实机器人在实际执行任务时的闭环交互。现实中的机器人需要在时间维度上做出连续决策,这需要更进一步的测评框架。

最后,StressDART的当前实现是一个概念验证,而非完善的工业级解决方案,它在某些情况下仍会出现"修正帮了倒忙"的情况。

归根结底,这项工作的核心价值,不在于给出一个完美的解决方案,而在于提供了一套有章可循、有物理依据的分析语言,让研究者能够准确描述和诊断AI视觉系统在现实物理环境中的薄弱环节。就像医院的体检报告一样,它不能让你立刻变健康,但它能告诉你哪里出了问题、问题有多严重、是什么原因导致的。

当机器人越来越多地进入家庭、医院、工厂,当AI视觉系统开始参与越来越重要的决策,这种诊断能力就变得格外关键。一个在实验室得了高分却在现实中频繁失手的AI,远比一个分数低一些但行为可预测的AI更危险——因为前者让人产生了错误的安全感。RoboStressBench的意义,正在于帮助我们更诚实地面对现有AI视觉系统的真实能力边界。有兴趣深入了解这项研究的读者,可以通过论文编号arXiv:2606.00828查阅完整原文。

Q&A

Q1:RoboStressBench测的是什么,和普通AI视觉评测有什么不同?

A:RoboStressBench专门测试AI视觉系统在真实物理环境中遇到光影、材质、角度和空间布局困扰时的表现,而普通评测通常用干净的照片或人工添加的数字噪点来测试,这两种情况在现实场景中都不常见。RoboStressBench的图片来自真实场景筛选、物理规律驱动的合成以及实地拍摄,更贴近机器人实际工作时看到的画面。

Q2:GPT-5.5和Gemini这些顶级模型在RoboStressBench上表现怎么样?

A:表现不算理想。GPT-5.5的整体准确率只有46.2%,Gemini-3.1是44.8%,也就是说大约有一半以上的题目这两个模型回答有问题。对比之下,同样的问题换成没有视觉压力的正常图片时,它们通常能答对。这说明物理世界的光影材质困扰确实会大幅影响顶级AI的判断,不能因为它们平时表现好就认为在现实机器人应用中也足够可靠。

Q3:StressDART是怎么提升AI在困难图片上的表现的?

A:StressDART分三步工作:先用一个AI模块诊断图片属于哪种物理视觉困扰,然后根据诊断结果对图片做有针对性的修正(比如暗图提亮、过曝区域恢复高光),最后把原始图片和修正后的图片一起提供给AI来回答问题。这个过程不需要重新训练任何模型,只在"使用时"临时干预。实验显示这种方法能把基础模型的准确率从43.2%提升到49%。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-