
这项由香港大学与英伟达(NVIDIA)联合领导、加州大学圣地亚哥分校参与合作的研究,以预印本形式发表于2026年6月16日,论文编号为arXiv:2606.17539,有兴趣深入了解的读者可以通过该编号查询完整论文。
**空间感知:一个藏在日常生活里的难题**
当你走进一个陌生的房间,你的大脑会在一瞬间完成许多事情:哪把椅子离门更近?桌上的台灯比书架高还是低?如果我从这头走到那头,中间有没有障碍物?这些判断对人类来说轻而易举,但对于今天最聪明的AI来说,却是一道真正的坎。
过去几年,AI在看图、读文字、回答问题等方面突飞猛进,但一旦涉及"三维空间"的判断,比如两个物体谁更远、从某个视角看这两样东西什么关系、搬一口锅从炉子到水槽中间会不会碰到什么障碍,AI就开始频繁犯错。研究团队把这种能力叫做"空间推理",它比单纯认出"这里有一把椅子"要复杂得多——需要把多个线索串联起来,经过好几步推断,才能得出答案。
更麻烦的是,不同的空间问题适合不同的解题思路。有些问题靠语言逻辑就能推出来,比如"书在桌子左边,灯在书右边,那灯和桌子什么关系?"这种题你不用拿尺子量,用脑子推就行。但另一些问题,比如"这两把椅子之间的距离是多少米",你就必须先把它们在三维空间里定位好,然后才能做计算。此前没有任何一个AI框架能同时把这两条路都走通,放在同一个模型里互相配合。
研究团队正是冲着这个问题去的。他们开发的SR-ReaL框架,给一个具备空间感知能力的AI模型同时装上了两套解题系统:一套纯靠语言推理,另一套先找到物体的三维坐标再做数学计算。两套系统在同一个模型里共存,互相促进,通过强化学习共同成长。
---
**一、为什么普通的AI读不懂三维空间**
以看图说话的AI为例——这类模型通常被叫做"视觉语言模型",你给它一张图,它能告诉你图里有什么。但是,"看到"和"理解三维关系"是两回事。人类的眼睛是靠立体视觉、经验积累和空间直觉来感知深度的,而AI看到的图片本质上是一个二维的像素矩阵,要从中推断出哪个物体离摄像机更近、两个物体在三维空间里差多远,本身就很困难。
研究团队在论文里提到,现有的AI系统在理解三维布局、深度信息、遮挡关系和视角依赖的方向判断上都有明显弱点。正因如此,出现了一类专门的"空间视觉语言模型",它们在训练时额外加入了深度图、摄像机参数等几何信息,让模型在感知层面就对空间有更好的理解。
但"感知"还不够。研究团队做了一个区分:空间理解(知道"这里有两个物体,左右关系是这样的")和空间推理(知道"如果观察者移到另一个位置,这两个物体的关系会变成什么")是两个不同层次的能力。后者需要多步骤的逻辑链条,而现有的空间模型在这方面还很薄弱。
SR-ReaL框架就是为了让AI从"空间感知"升级到"空间推理"而诞生的。研究团队把这个框架建立在一个已有的空间模型SR-3D之上,并通过两个关键升级来实现目标。
---
**二、双路径:语言推理与坐标计算,各司其职**
研究团队把SR-ReaL的核心设计比作给模型配备了两条解题通道,根据问题性质自动选择更合适的那条。
第一条通道叫做"语言独立推理",英文缩写LOR。顾名思义,这条路全靠语言逻辑来解题。模型会一步一步地在脑子里推导:这个物体在那个物体的左边,而那个物体在观察者的前方,因此这个物体在观察者的左前方……整个过程就像小学数学里的"图解题",不需要任何坐标或数字,只需要把场景关系理清楚,逐步推出答案。
第二条通道叫做"先检测再推理",英文缩写DTR。这条路的逻辑更像工程师解题:先找到图中相关物体,用模型的视觉定位能力预测它们在三维空间里的坐标,然后用这些坐标做数学计算——比如用三维欧氏距离公式算两点之间的距离,或者用向量点积判断方向关系。这条路的优势是精确,但前提是先得到准确的三维坐标。
为了让DTR能够真正拿到三维坐标,研究团队引入了一个叫"区域到三维检测"的接口。具体来说,当系统需要定位某个物体时,它不是直接从文字描述中猜测坐标,而是先在图像上圈出那个物体的区域(用一个叫"区域token"的视觉标记表示这个圈),然后让模型根据这个视觉区域预测该物体在三维空间中的中心坐标或三维边界框。这个过程把"语言理解"和"三维感知"解耦了——模型不需要用语言猜位置,而是用眼睛看位置。
实验验证了这个设计的重要性:如果去掉区域标记,直接让模型从文字中预测坐标,性能会大幅下滑;加上区域标记后,定位精度明显提升,最终的推理准确率也随之提高。
两条通道在同一个模型里共存,通过输入提示词来切换:当系统提示指定用LOR模式时,模型输出纯语言推理链;当提示指定用DTR模式时,模型会先输出一个包含三维坐标的检测结果块,再进行数学推理,最后给出答案。
---
**三、两阶段训练:冷启动打基础,强化学习磨锋芒**
教会模型用这两套思路解题,需要一套精心设计的训练流程。研究团队把训练分成了两个阶段,就像先在课堂里学理论,再去实战考场里磨练。
**第一阶段:冷启动监督微调**
在这个阶段,研究团队给模型提供大量的"解题示范",让它先学会两种推理路径的基本格式和逻辑。
为了准备LOR的训练数据,研究团队拿出一批空间问答对——问题和答案都是已知的——然后让一个更大的语言模型(Gemini-2.5-Pro)去"扮演"解题老师,为每道题生成一条步骤清晰的语言推理链。这些推理链要求简洁但精准,每一步都要把观察到的空间关系和最终答案联系起来。
为了准备DTR的训练数据,研究团队则在语言推理链的基础上增加了三维坐标信息。他们从一个叫SPAR的数据集中找到标注了二维区域的空间问题,然后把这些二维区域对应的三维物体注释从另一个叫EmbodiedScan的三维数据集里投影过来,拿到真实的三维坐标。每个DTR训练样本的格式是:先一个检测块(列出相关物体的三维坐标),然后是利用这些坐标进行计算的推理步骤,最后是答案。
除了这两种推理数据,研究团队还在训练数据里混入了三种其他类型的数据:二维和三维物体定位数据(教模型认识"这个区域对应哪里"),区域提示的空间问答数据,以及普通的多模态问答数据(防止模型只会解空间题,忘了其他基本能力)。
这个"混合配方"非常关键。研究团队发现,如果只喂推理链数据,模型会迅速"走火入魔"——它只会背推理模板,一旦遇到没见过的问题类型就彻底崩掉。混入多种数据后,模型的泛化能力明显更强,在完全没见过的数据集上也能表现稳定。
整个冷启动阶段大约使用了一百万条训练样本,在SR-3D基础模型上训练两轮,使用5×10??的学习率,批次大小128,运行在32块英伟达A100显卡上。
为了确保训练数据的质量,研究团队还做了两步过滤:首先自动过滤掉推理链结论与标准答案不一致的样本,然后再用一个语言模型检查推理过程在逻辑上是否自洽、中间计算步骤是否正确。
值得一提的是,研究团队还专门构建了一批"复杂空间任务"数据,涵盖导航路径规划、物体操作推理和场景布局判断等更高层次的任务。这些数据来自室内三维场景数据集CA-1M和自动驾驶数据集NuScenes,通过提示大型语言模型生成对应的推理题目和解答过程,共生成约两万条样本。
**第二阶段:强化学习精炼推理**
打好基础之后,第二阶段的强化学习相当于让模型去参加真实考试,靠自己的表现反复调整策略。
研究团队使用的强化学习算法叫GRPO(群体相对策略优化),它的工作原理可以这样理解:给模型一道题,让它独立生成多个版本的回答(比如八个);然后比较这八个回答的质量,表现比平均水平好的回答获得正向奖励,表现差的获得负向奖励;模型根据奖励信号调整自己的策略,倾向于生成更好的回答。这个过程完全不需要人类标注,靠规则自动评分。
奖励信号由三部分组成。首先是格式奖励:LOR路径要求输出符合"思考-答案"结构,DTR路径要求输出符合"检测-思考-答案"结构,不符合格式的回答直接得零分。其次是准确率奖励:对于选择题,直接看选项是否匹配;对于填空题(比如估计距离),用一个指数平滑的相对误差公式计算得分,预测值越接近真实值得分越高。第三是DTR专属的检测奖励:对于DTR路径,系统会提取模型预测的三维中心坐标,计算与真实坐标之间的距离,然后按照一个分档规则给分——距离越近得分越高,距离超过一定阈值就得零分。这个分档设计让奖励信号既连续又不会因为极端误差而失去参考意义。
此外,研究团队还引入了一个"在线过滤"机制:如果某道题生成的所有回答得分完全相同(说明这道题对模型来说太简单或太难,无法提供有用的训练信号),就直接跳过这道题,把训练资源集中在更有挑战性的样本上。这个机制让模型在200步训练内就收敛到报告成绩,而没有过滤的版本需要三百步才能达到同等水平。
强化学习阶段使用了大约二十万道空间问题,其中一半来自SPAR数据集(提供单视角和多视角问题),另一半来自研究团队自己构建的OpenImages衍生数据集——他们从OpenImages图库的每张图里提取物体分割掩码,结合单目深度估计生成每个物体的近似三维点云,再从中估算三维边界框,然后随机选取两个或更多物体生成描述它们空间关系的选择题。这个自动流水线大大扩展了训练数据的多样性。
---
**四、实验结果:双路径互相成就,效果远超基线**
研究团队在多个不同类型的空间测试集上评估SR-ReaL的性能。
在SPAR-Bench上,这是一个专门为空间推理设计的综合基准,包含二十个子任务,覆盖深度预测、距离推断、物体空间关系、空间想象等多个维度,同时包含单视角和多视角问题。SR-ReaL的LOR路径得到60.5分,DTR路径得到61.9分,而基础模型SR-3D只有33.4分——提升幅度分别约为27和28.5个百分点,是非常显著的进步。相比之下,其他专门针对空间推理的模型,比如SpatialLadder的34.4分、SpaceR的39.2分、VST的48.9分,SR-ReaL都明显领先。
在细分任务上,DTR路径在需要精确计算的任务上优势更明显。以单视角深度预测为例,DTR比LOR高出4.9个百分点;在单视角距离推断上,DTR比LOR高出5个百分点。而在更依赖语言逻辑的空间关系判断和空间想象任务上,两条路径的表现相当接近,DTR也仍然略有优势或持平。
在EmbSpatial基准上——这个测试集专门考察具身环境(比如机器人视角)中的空间位置关系——DTR路径达到81.3分,LOR路径达到79.2分,基础模型只有72.5分。在SAT基准上——这个测试集关注动态场景中的全局空间推理,没有区域标注因此只能用LOR路径——SR-ReaL达到68.7分,高于基础模型的63.0分。
研究团队还测试了模型在三个完全没有参与训练的"域外"数据集上的表现。在BLINK(空间子集)上,当模型直接回答(不走推理链)时达到87.4分,高于基础模型的83.9分;在CVBench上直接回答模式得88.1分,与基础模型的88.9分基本持平。有趣的是,在这些域外数据集上,强制使用推理链反而会降低性能,说明模型还没有完全学会"什么时候该推理、什么时候该直接回答"。研究团队在论文中诚实地指出了这个局限性。
---
**五、消融实验:每个设计选择都有它的道理**
研究团队做了一系列"如果去掉某个设计,会发生什么"的对比实验,来验证每个组件的贡献。
**联合训练的互相促进效应**
研究团队分别训练了只有LOR路径的模型和只有DTR路径的模型,然后与同时训练两条路径的完整模型做比较。结果显示,只训练LOR的模型在LOR推理下得58.0分、EmbSpatial上75.9分;只训练DTR的模型在DTR推理下得57.2分、EmbSpatial上71.4分;而同时训练两条路径的完整模型,LOR推理下得58.7分、DTR推理下得60.8分,EmbSpatial上LOR得77.6分、DTR得78.8分。
这个结果说明两条路径并非相互竞争,而是互相借力。LOR路径的语言推理训练帮助DTR路径建立了更扎实的空间逻辑基础,避免DTR过度依赖坐标计算而忽视整体空间感;反过来,DTR路径的显式三维坐标训练也强化了模型对几何关系的底层理解,进而提升LOR路径的推理质量。
**检测奖励和区域接口的重要性**
去掉强化学习阶段的检测奖励后,DTR路径在SPAR-Bench上从60.6分降至59.9分,在EmbSpatial上从78.5分降至76.0分,三维定位误差从0.45米升至0.78米。去掉区域token接口(直接从文字猜三维坐标)后,定位误差更是升至0.67米,SPAR-Bench降至59.3分,EmbSpatial降至74.8分。两项消融都表明,"先圈定区域再预测坐标"的设计对DTR路径的精度至关重要。
**冷启动数据的组成**
研究团队还系统测试了冷启动阶段不同数据来源的贡献。只有SPAR推理链数据时,模型在SPAR-Bench上表现不错(69.30分),但在EmbSpatial上只有64.34分,而且在域外任务上会产生混乱的推理。依次加入来自CA-1M的复杂任务数据、通用多模态问答数据和区域相关微调数据后,EmbSpatial得分逐步从64.34提升到68.81、76.55,最终到76.90,说明每种数据来源都在不同维度上强化了模型的能力。
**冷启动与强化学习的配合**
只做冷启动不做强化学习时,SPAR-Bench(单视角)得56.53分;直接做强化学习跳过冷启动时得62.34分,虽然数字更高,但生成的推理链经常逻辑错乱,答案和推理过程自相矛盾;完整两阶段流程达到72.21分,而且推理链质量更高更可靠。这个对比说明冷启动不仅仅是为了提高准确率,更是为了让模型形成连贯一致的推理习惯。
---
**六、模型实际表现什么样:几个具体案例**
研究团队在论文中展示了几个直观的推理案例,帮助读者感受两条路径的实际差别。
在一道空间关系判断题中,问题是"桌子(红框)相对于落地扇(蓝框)的位置关系是什么"。LOR路径的推理是:桌子在落地扇的左边;桌子离观察者更远;两者高度差别不大所以无明显上下关系;因此答案是"左边,无上下,更远"。DTR路径则先输出检测结果:桌子中心坐标[-0.77, 0.5, 3.68],落地扇中心坐标[0.97, 0.47, 2.21];然后比较x坐标(-0.77 < 0.97,所以桌子在左边),比较y坐标(差值0.03,微乎其微,无法区分上下),比较z坐标(3.68 > 2.21,所以桌子更远);最终得出相同答案。两条路径都答对了,但DTR的推理过程更精确可追溯。
在一道多视角距离估算题中,问题是"图中红色点标记的椅子中心和蓝色点标记的椅子中心距离多少米"。LOR路径依靠视觉估计,给出了1.9米的答案,而真实答案是2.9米。DTR路径则先定位两把椅子在第一视角坐标系中的三维坐标,用欧氏距离公式精确计算,得到2.7米,更接近真实答案。这个案例清楚地说明了在需要精确定量计算的任务上,DTR的优势所在。
研究团队还展示了一道导航规划题:如何从房间右侧的门走到左侧房间的门。LOR路径通过观察场景布局,推断出需要绕过中间的沙发和茶几,给出了正确的路径描述。这类任务不需要精确坐标,靠语言推理就能很好地解决。
---
**七、这个研究的边界:诚实面对不足**
研究团队在论文中明确列出了若干局限性,这种坦诚值得关注。
SR-ReaL的基础是SR-3D模型,而SR-3D在推理时需要输入深度图和摄像机的内外参数。这意味着这套系统目前无法直接用于没有深度传感器的普通照片——你用手机随手拍的图,暂时还不能直接交给这个模型做完整的空间推理。
DTR路径依赖于图像上的区域标注。如果问题本身没有指定具体物体的区域(比如SAT测试集里的全局场景问题),DTR就无法工作,只能退回到LOR。如何在没有人工标注的情况下自动生成可靠的区域提示,是一个尚待解决的开放问题。
尽管在域外数据集上整体表现不错,但对于感知密集型任务(比如BLINK和RealWorldQA),使用推理链反而比直接回答表现更差。这说明模型还没有完全学会"何时深思,何时速答"——对于一眼就能看出答案的题,绕一大圈推理反而容易出错。
此外,冷启动阶段的推理链数据是用Gemini-2.5-Pro生成的,这引入了对商业API的依赖,也意味着数据质量受制于外部模型的能力。
---
说到底,SR-ReaL这项研究真正有价值的地方,不只是那些数字上的提升,而是它提出的一个朴素但实用的观点:不同的空间问题天然适合不同的解题策略,与其强迫所有问题都用同一种方式解答,不如给模型配备两套互补的工具,让它根据问题性质灵活切换。而通过强化学习让两套工具在同一个模型里相互强化,更是打破了"多任务训练必然相互干扰"的直觉。
这项研究距离让AI真正像人一样理解和导航三维世界还有不少距离,但它在"从感知到推理"这条路上迈出了一步扎实的步伐。对于机器人导航、辅助驾驶、虚拟现实交互乃至帮助视障人士理解场景这些应用来说,空间推理能力的提升都意味着实实在在的帮助。
如果你想深入了解这项研究的技术细节,可以通过编号arXiv:2606.17539查找完整论文,或访问研究团队的项目页面sr-real.github.io了解更多信息。
---
**Q&A**
Q1:SR-ReaL的两种推理路径LOR和DTR分别适合什么类型的空间问题?
A:LOR(语言独立推理)适合靠逻辑关系就能推断的问题,比如判断方向、描述相对位置这类不需要精确数字的题;DTR(先检测再推理)适合需要精确定量计算的问题,比如计算两物体之间的距离、判断深度数值等,因为它先定位物体的三维坐标,再用数学公式得出结果。
Q2:SR-ReaL训练时为什么不能只用推理链数据,还要混入其他类型数据?
A:研究团队发现,单独用推理链数据训练会让模型"钻进牛角尖"——只会套用见过的推理模板,一旦遇到没见过的问题类型就完全失效,还会损失原来的通用视觉语言能力。混入三维定位数据、普通问答数据和区域感知数据后,模型的泛化能力明显更强,在陌生数据集上也能保持稳定表现。
Q3:SR-ReaL的强化学习阶段是如何评判模型回答好坏的?
A:系统用三类奖励信号打分。格式奖励检查输出是否符合规定结构;准确率奖励对选择题直接看答案对不对,对填空题用预测值与真实值的误差计算得分;DTR路径还额外有检测奖励,评估模型预测的三维坐标与真实坐标有多近,分档给分,距离越近奖励越高。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。