微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 约翰斯·霍普金斯大学等机构联合研究:让RGB成为视觉世界的"通用语言"

约翰斯·霍普金斯大学等机构联合研究:让RGB成为视觉世界的"通用语言"

2026-07-23 17:11
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-23 17:11 科技行者

这项由约翰斯·霍普金斯大学、加州大学圣克鲁兹分校、卡内基梅隆大学和莱斯大学联合开展的研究,以预印本形式于2026年7月14日发布在arXiv平台,编号为arXiv:2607.12450。感兴趣的读者可以通过该编号在arXiv上找到完整论文。

**一、每个人都看得懂的颜色,能否承载所有视觉信息?**

手机里有三种颜色信号组成了你看到的一切——红色、绿色和蓝色,也就是我们常说的RGB。不管是一张海边日落的照片,还是一幅精细的地图,屏幕上显示的所有内容,最终都被分解成这三种颜色的数值组合。这件事听起来平平无奇,却隐藏着一个令人着迷的问题:如果RGB能表达自然界里几乎所有的视觉信息,那它是否也能成为人工智能理解和创造视觉内容的"通用语言"?

这正是这篇论文所探索的核心问题。研究团队提出了一个名为"RINO"(RGB In and RGB Out,即"RGB输入、RGB输出")的框架,试图用一种极为大胆的方式来统一人工智能的视觉理解能力:不管是让机器"看懂"一张图片并分析出里面有什么物体、物体有多深、表面朝向什么方向,还是让机器根据一张草图或骨架图生成一张真实感十足的照片,统统用RGB图片来表示输入和输出,用同一个图像编辑模型来完成所有任务,不需要为每个任务单独设计专用的模块。

这个想法的灵感来自于语言模型的成功。在处理文字的大模型中,不管是翻译、写作还是回答问题,所有任务都以文字为输入、文字为输出,同一个模型就能搞定。RINO的研究者问:视觉世界能否也拥有这样一种"通用文字"?他们的答案是:可以,而这种"通用文字"就是RGB图像本身。

**二、视觉任务的"巴别塔困境":为什么以前的做法那么麻烦?**

在RINO出现之前,计算机视觉领域面对不同任务时,采取的策略有些像建造一座每层都用完全不同语言交流的"巴别塔"——每种任务都有自己专属的表达方式,不同任务之间几乎无法共享一套通用的基础设施。

以几个常见任务为例来理解这种困境。当人工智能需要判断一张照片里每个像素属于哪个物体类别(也就是"语义分割"任务)时,它的输出是一张颜色涂抹图,每种颜色代表一个类别;当它需要估算照片里每个点距离相机有多远("深度估计"任务)时,输出是一张灰度图,越亮代表越近;当它需要生成一张符合特定姿势的人物图片时,则需要先把姿势骨架作为特殊格式的输入信号读取进来。这些输入输出格式各不相同,导致工程师们不得不为每种任务设计专用的"读取器"(编码器)和"输出器"(解码器),并且还需要额外的"连接适配器"让它们和主模型通信。

这种做法就像一个家里有十几台电器,每台都需要专属的不同形状插头,换一台电器就得换一套插头——不仅麻烦,而且每次都要从零开始学习怎么用新设备。RINO的思路则是:给所有电器都装上标准USB接口,统一进出,一个适配器走遍天下。

**三、RINO的核心思路:把一切都"画"成RGB图片**

RINO框架的核心做法非常直观:不管原本的视觉信息是什么格式,在送进模型之前或从模型出来之后,都先把它转换成一张看得见摸得着的RGB彩色图片。

以深度估计为例,研究者不是让模型输出一堆抽象的数字来表示距离,而是直接让模型输出一张"深度可视化图"——近处的物体显示为亮色,远处的物体显示为暗色,就像摄影师拍摄的那种黑白色调的三维感照片。这张图依然是普通的RGB图,人眼可以直接看懂,也不需要任何专门的解码器。模型做的事,只是把一张普通照片"重新画"成一张深度可视化图而已,就像一个画家把风景临摹成素描。

对于语义分割,研究者让模型输出一张颜色涂抹图,每个区域涂上对应类别的颜色,比如天空涂成蓝色、草地涂成绿色——同样是一张普通RGB图。对于人体姿态估计,模型输出的是一张OpenPose风格的骨架图,用不同颜色的线条画出人体各部位的连接关系。

在"生成"方向上,RINO同样把一切输入都当作普通RGB图片来处理。比如,要让模型根据一张语义分割图生成真实图片,就直接把那张分割图当作普通图片输入进去,然后用文字描述告诉模型"请根据这张分割图生成对应的真实场景"——不需要额外的分割图编码器,不需要ControlNet(一种专门处理条件控制生成的附加模块)。

整个RINO框架可以用一个简洁的公式概括:给模型一张图加一段文字描述,模型输出一张图加一段可选的文字说明。输入的图可以是自然照片、深度图、骨架图、分割图;输出的图同样可以是以上任何一种。模型永远只看到RGB图片,永远只输出RGB图片,内部的一切逻辑都在这个统一的视觉空间里完成。

在模型输出之后,如果需要将RGB图片还原成某种任务专用的格式(比如把深度可视化图换算回每个像素的具体距离数值),研究者会用一个完全不含可学习参数的"转换器"来完成这个工作——就像一把固定的换算尺,不需要额外训练。

**四、选什么模型来做这件事?**

RINO框架本身不训练任何新模型,而是直接借用已有的"图像编辑模型"作为底座。研究团队选择了三款开源的图像编辑模型,分别是Qwen-Image-Edit(阿里巴巴通义团队开发,参数量高达200亿,基于多模态扩散Transformer架构)、LongCat-Image-Edit(美团开发,60亿参数,双语版本)以及FireRed-Image-Edit(FireRed团队开发,专注于高保真指令式图像编辑)。

这三款模型本来是为了"按照文字描述修改图片"而训练的,比如"把天空改成黄昏的颜色"或者"给这个人换一件红色外套"。RINO的做法是:直接把这些模型当作黑盒子来使用,不修改任何参数,不添加任何新模块,只是通过精心设计的文字提示(prompt)来引导模型完成各种视觉任务。

这是整个研究中最令人惊讶的部分——一个本来用来修图的模型,在完全没有专门训练的情况下,居然能够做深度估计、语义分割、人体姿态估计等专业任务,而且效果与专门训练的专家模型相差无几。研究者把这种完全零样本(zero-shot,即没有针对目标任务进行任何微调或训练)的版本称为"RINO-Zero"。

**五、理解任务的成绩单:从深度图到骨架图,零样本能做到几分?**

研究团队在超过20个视觉任务和基准测试上评估了RINO-Zero,涵盖了视觉理解和视觉生成两大方向。每项任务的结果都被与该领域的专业模型进行了横向比较,相当于让一个"通才选手"和多个"专项冠军"同场竞技。

在深度估计任务上,评估指标使用的是δ?(一种衡量预测深度与真实深度吻合程度的分数,越接近1越好)和AbsRel(绝对相对误差,越低越好)。在NYUv2(室内场景数据集)上,Qwen-Image-Edit达到了δ?=0.927,而专门为深度估计训练的Depth Anything V1的成绩是0.981,差距约为5个百分点。在DIODE-indoor(另一个室内数据集)上,Qwen表现更为接近,达到δ?=0.938,而Depth Anything V1为0.952,差距缩小到约1.4个百分点。在自然图像差异较大的KITTI(室外道路场景)上,Qwen达到δ?=0.901,与专家模型的0.947相比差距略大。另一款LongCat-Image-Edit在所有数据集上表现稍弱,约在0.840到0.849之间。

在表面法线估计(判断场景中每个表面朝向哪个方向的任务)上,FireRed-Image-Edit表现尤为突出。以平均角度误差(数值越低越好)为指标,在NYUv2上FireRed取得了17.73度的平均误差,而专门为此训练的DSINE模型为16.4度;在iBims-1数据集上,FireRed的18.62度已非常接近DSINE的17.1度;在DIODE-indoor上,FireRed甚至以17.25度的成绩超越了多款专家模型,包括Marigold(16.67度仍优于FireRed,但差距极小)和StableNormal。这意味着在平均表面朝向预测精度上,零样本通才模型已经可以与专门训练的专家模型比肩,只是在局部精细度上还有提升空间。

语义分割任务上,RINO在VOC(Pascal VOC,一个经典的图像分类和分割数据集)上取得了相当不错的成绩。以mIoU(平均交并比,衡量分割区域与真实区域重叠程度的指标,越高越好)为主要指标,LongCat-Image-Edit在Pascal VOC上达到了49.68,超越了多个零样本分割专家模型,例如GroupViT的52.37虽然更高,但OVSegmentor(53.82)等更好的专家模型还是领先的。值得关注的是,RINO在mAcc(平均类别准确率)和aAcc(所有像素准确率)两项指标上甚至超越了部分专家模型。在难度更大的ADE20K数据集10类粗粒度设置下,Qwen-Image-Edit达到了40.37的mIoU,与零样本专家模型MaskCLIP的39.26相当甚至略有超越。在150类细粒度设置下,RINO的表现有所下滑,这说明面对极细分的类别区分时,通用图像编辑模型还需要更多任务特定的知识来弥补差距。

在目标检测和实例分割任务上,RINO采用了一种非常有创意的方法:对于每个类别,让模型把该类别的所有实例"涂"成白色实心区域,背景涂成黑色,然后通过图像处理技术把不同的白色区域分离成独立的实例。在COCO(一个包含80个物体类别的大型基准数据集)上,Qwen在零样本条件下达到了16.3%的box AP50(边界框检测的宽松准确率),与专门训练的Mask R-CNN的63.5%相比差距依然很大,但考虑到这是完全零样本且没有任何专用参数,能达到非零的有意义结果本身就相当惊人。视觉上,模型已经能够大致定位和区分不同实例,主要失败原因是过度检测或过度分割。

全景分割(同时识别"东西类"如天空、草地等背景区域和"事物类"如人、车等可数对象的任务)的评估结果颇为有趣。虽然RINO在综合分数PQ(全景质量)上远低于专家模型,但在SQ(分割质量,衡量分割出的区域形状有多准确)这一子指标上,Qwen的成绩非常亮眼——在Cityscapes、ADE20K和COCO三个数据集上分别达到64.8、71.5和74.3,接近乃至超越了部分有监督专家模型的水平。这说明RINO已经能够相当准确地识别和勾勒出物体的边界,主要的短板在于识别阶段——知道"这里有个边界",但不太确定"边界两侧分别是什么类别"。

人体姿态估计是一个对精度要求极高的任务,RINO的表现说明了通用模型的局限和潜力并存。采用PCK(Percentage of Correct Keypoints,关键点正确率)评估指标,在绝对坐标下(raw),三款编辑模型的得分都较低,最高的LongCat也只有0.233。但在经过位置对齐处理之后(PA,即忽略平移和缩放的误差,只看关键点的相对位置是否正确),成绩明显提升,三款模型在PA PCK@0.2(更宽松的阈值下)都达到了0.767到0.795,说明模型其实能够理解人体姿态的大致结构,只是在精确定位上还与专业模型(如ViTPose的0.868 raw PCK@0.05)有差距。

指代表达理解和分割(根据一段语言描述定位图片中特定物体)任务上,Qwen-Image-Edit在RefCOCOg数据集上取得了Prec@0.5(预测框与真实框重叠超过50%的比例)51.8%的成绩,以及cIoU(累积交并比)40.3%的分割成绩。与监督训练的专家模型UNINEXT(88.7% Prec@0.5)相比差距明显,但考虑到这是完全零样本、没有任何接地模块或框监督的情况下实现的,已经表明通用图像编辑模型确实具备将语言描述与像素级视觉定位联系起来的初步能力。

开放词汇实例分割(在SA-Co/Gold数据集上)的评估结果揭示了RINO在一项特定能力上的不足:虽然Qwen在pmF1(正样本掩码F1得分)上达到39.8,展现出一定的概念定位能力,但在IL_MCC(判断某个概念是否存在的准确率)上接近0,导致综合得分cgF1极低(仅1.7)。这是因为当被查询的概念不在图片中时,编辑模型倾向于依然"画"出一个掩码,而不是输出"不存在"。这一局限性与具体任务的识别逻辑有关,并非RGB接口本身的根本缺陷——即使是Vision Banana(一个专门针对此任务改进的生成模型)也需要借助外部语言模型来完成存在性判断。

**六、生成任务的成绩单:把各种"草图"变成真实图片**

在视觉生成方向,RINO把各种条件信号(深度图、语义分割图、人体骨架图、实例图、边缘图)当作普通RGB图片输入,然后让图像编辑模型生成符合条件的真实照片。这个方向的比较对象是那些专门为条件控制生成而训练的模型,例如大名鼎鼎的ControlNet系列。

在深度条件图像生成任务上,遵循MultiGen-20M数据集的标准评估协议,用三个指标来衡量:RMSE-255(由生成图片反推出的深度图与输入深度图的误差,越低越好)、FID(衡量生成图片质量与真实图片分布差异的指标,越低越好)以及CLIPScore(衡量生成图片与文字描述吻合程度的指标,越高越好)。Qwen-Image-Edit在零样本条件下达到了RMSE-255=33.83,与专为此任务训练的ControlNet(35.90)和GLIGEN(38.83)相比不仅不落下风,甚至略有优势,但落后于最强的ControlNet++(28.32)。这个结果相当有说服力:一个从来没有为深度条件生成专门训练过的模型,仅凭把深度图当作普通图片输入,就能达到与多个专门训练模型相当的条件控制精度。

语义分割图条件生成任务的结果更加令人印象深刻。在ADE20K数据集上,三款编辑模型的条件遵循度(mIoU)均在45至46之间,而专为此任务训练的ControlNet++仅为43.64,ControlNet更只有32.55——三款零样本编辑模型全面超越了专门训练的条件控制模型。同时,FID和CLIPScore也与ControlNet++相当甚至持平。在COCOStuff数据集上,同样的规律成立,RINO的三款模型mIoU均在36至38之间,同样超越了ControlNet和ControlNet++的34.56。这意味着,在语义分割图条件生成这项任务上,RINO-Zero已经建立了新的零样本技术水平(state of the art)。

人体姿态条件生成任务在Human-Art数据集上进行评估,使用CAP(基于余弦相似度的平均精度,衡量生成图片的姿态与输入骨架的吻合程度)、PCE(人数计数误差)、FID和KID(核初始分布距离,另一种图片质量指标)以及CLIP-Score来综合评估。FireRed-Image-Edit达到了CAP=68.09,非常接近监督训练的专家模型HumanSD(69.68)和Stable-Pose(70.83);同时FID=10.66,在所有方法中处于前列。Qwen的CAP=65.97,与T2I-Adapter(65.65)相当,超越了基础SD模型(55.71)。从视觉效果来看,RINO生成的图片在处理不寻常的人体姿态或多样艺术风格时,往往比ControlNet类方法更为自然。

实例图条件生成任务在COCO2017上进行,评估指标为AP、AP50和平均召回率(AR)。LongCat-Image-Edit以AP=28.0、AR=44.2的成绩超越了专为此任务训练的InstanceDiffusion(AP=27.1、AR=38.1),Qwen和FireRed也与其接近。同时,三款编辑模型的FID(15.3至18.5)均优于InstanceDiffusion的25.5,说明生成图片的视觉质量更高。这是另一项RINO超越专门训练模型的任务。

Canny边缘图条件生成任务的结果相对不那么理想。以边缘F1分数(衡量生成图片中的边缘与输入Canny边缘图的匹配程度)为主要指标,Qwen的零样本边缘F1为14.90,而专门训练的ControlNet++为37.04,差距显著。研究者做了一个重要的对照实验:如果不提供边缘图,只给文字描述,F1只有6.75;如果把边缘图用语言模型描述成文字再输入,F1也只有7.79,远低于直接把边缘图作为图片输入的14.90。这说明边缘图中携带的空间像素信息,是无法通过语言描述来替代的——RGB图片作为输入接口,确实传递了纯文字无法传递的空间布局信息。

**七、研究的诚实局限:通才与专才之间的真实差距**

研究团队对RINO的局限性保持了相当直接的态度。RINO的强大转移能力在很大程度上依赖于底座图像编辑模型在互联网规模数据上进行的预训练,这些预训练数据里可能已经包含了少量的深度图、分割图等视觉信号,使得模型对这些格式并不完全陌生。然而这类信号在预训练数据中占比极小,这解释了为什么RINO在某些任务上与专家模型仍存在明显差距。

RINO的当前版本是完全零样本的,没有在任何视觉任务数据上进行过针对性的微调。研究者预期,如果未来将标准图像编辑训练数据与一定比例的RGB格式视觉任务数据(如深度图、分割图)混合进行指令微调,RINO框架在更广泛任务上的表现将得到显著提升,这一改进版本被称为未来的"RINO-Tuned"。

此外,在某些具体任务上,RINO暴露出一些特定的失败模式。在开放词汇分割中,模型不能可靠地判断一个概念是否出现在图片中;在目标检测中,模型容易过度检测;在细粒度分割中(如ADE20K 150类),模型对细分类别的识别能力不足。这些问题都与模型预训练数据和任务设计有关,而非RGB接口的根本缺陷。

**八、为什么这件事在技术上是可能的?**

要理解RINO为什么能成立,需要理解现代大型图像编辑模型的本质。Qwen-Image-Edit这类模型在训练过程中接触了海量的(图片,文字描述,编辑后图片)三元组数据。在这个过程中,模型学会了理解图片中的语义内容、空间结构、颜色与纹理,以及如何根据文字指令对这些视觉信息进行变换。

这种训练方式无意间赋予了模型一种"视觉语言能力"——它能够理解"把这个区域的颜色改成..."、"按照这张参考图的风格..."等指令的含义,并在视觉空间中执行这些操作。RINO做的事情,本质上是把"深度估计"任务描述成一种特殊的图像编辑指令:"把这张照片重新绘制成一张深度可视化图,近处亮远处暗"。模型在理解和执行这个指令时,动用的是它在预训练中学到的整个视觉理解体系,而这个体系恰好足够通用,能够完成这项"翻译"工作。

这种能力的存在,说明在大规模视觉数据上训练的图像编辑模型,已经内化了足够丰富的视觉知识,使得RGB接口成为一个有实际意义的通用视觉语言,而不仅仅是一个理论上的可能性。

**九、这对未来意味着什么?**

说到底,RINO提出了一个迷人的可能性:就像大语言模型用文字统一了所有自然语言任务一样,视觉世界也许可以用RGB图片作为统一接口,把感知和生成融合在一个框架下。

这不仅仅是技术上的简化——它意味着未来的视觉AI系统可能更接近人类的视觉认知方式。人类看世界时,深度感、物体识别、空间理解都发生在同一套视觉系统中,不需要每种感知都用单独的"模块"来处理。RINO迈出的这一步,朝着这个方向走得比以前更远。

当然,现在的RINO-Zero还有明显的成长空间。研究团队也明确表示,他们打算通过将RGB格式的视觉任务数据混入训练来进一步强化这个框架,并希望将其扩展到3D视觉、视频理解乃至世界模型等更宏大的领域。

如果你对这项研究感兴趣,可以通过arXiv编号2607.12450查阅完整论文,或访问论文提到的开源代码仓库进一步探索。

---

Q&A

Q1:RINO框架和传统视觉AI方法相比最大的区别是什么?

A:传统视觉AI为每种任务设计专用的输入输出格式和专用模块,比如深度估计有专门的深度头,分割有专门的分割头。RINO则把所有视觉信息统一表示为普通的RGB彩色图片,用同一个图像编辑模型完成所有任务,不需要任何任务专用模块,类似于语言模型用文字处理所有文字任务。

Q2:RINO在哪些任务上效果最好、哪些任务上还有明显差距?

A:RINO在语义分割图条件图像生成、实例图条件生成等生成类任务上已经超越了专门训练的模型;在深度估计、表面法线估计上接近专家模型水平。在目标检测、细粒度分割(如150类ADE20K)和Canny边缘条件生成等任务上与专家模型仍有明显差距,主要原因是这些任务需要更精确的空间定位或细分类别识别能力。

Q3:RINO有没有对模型进行额外训练?

A:RINO-Zero版本完全没有进行任何针对视觉任务的训练或微调,直接借用已有的图像编辑模型(如Qwen-Image-Edit、FireRed-Image-Edit、LongCat-Image-Edit)作为黑盒子来使用,所有参数均保持不变。研究者提到未来计划通过混合RGB格式视觉任务数据进行指令微调来进一步提升效果。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-