微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 谷歌DeepMind等机构证实:让AI先"看懂"世界,再让它"画出"世界,视觉智能的终极答案藏在视频生成里

谷歌DeepMind等机构证实:让AI先"看懂"世界,再让它"画出"世界,视觉智能的终极答案藏在视频生成里

2026-07-22 15:40
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-22 15:40 科技行者

这项由谷歌DeepMind、多伦多大学、伦敦大学学院、牛津大学、麻省理工学院及隆德大学联合开展的研究,以预印本形式于2026年7月10日发布,论文编号为arXiv:2607.09024。有兴趣深入了解的读者可通过该编号在arXiv平台查询完整论文。

**计算机视觉的"专科医院困境"**

医疗体系里有一种现象让很多人感到困惑:同一个病人,量血压要去心内科,看眼睛要去眼科,检查骨骼要去骨科,每个科室的医生都只认识自己负责的那一块。这当然有其道理,但如果有一位全科医生,能一次性完成所有评估,岂不更好?

当前的计算机视觉领域,正深陷一种类似的"专科医院困境"。人工智能要识别图中的人在哪里,需要用一个叫做"Segment Anything"的专门模型;要估算照片里物体离镜头有多远,需要另一个叫做"Depth Anything"的专门模型;要理解人的姿势、分析相机角度,又需要各自不同的专门模型。每一个"专科医生"在自己的领域都非常厉害,但他们彼此互不相通,整个视觉AI系统像一座分科极细的专科医院,缺少那位能统揽全局的全科大夫。

与此形成鲜明对比的是自然语言处理领域——也就是让机器理解和生成人类语言的技术领域。那里已经出现了ChatGPT这样的"全科大夫":同一个模型,既能翻译法语,又能写诗,还能解数学题,做代码审查。语言AI之所以能实现这种大统一,核心秘诀是一种叫做"下一个词预测"的训练方式:让模型不断猜测下一个词是什么,通过海量文本的反复练习,模型自然而然地理解了语言的方方面面。

那么,视觉AI能否也找到这样一种"万能训练秘方"?谷歌DeepMind领导的研究团队给出了他们的答案:那个秘方,藏在**视频生成**里。

他们提出了一个名为**GenCeption**的系统,并通过大量实验证明:先让AI学会"生成逼真视频",再让它转型做"视觉感知",效果比从零开始专门训练的感知模型更好,有时甚至超过那些在特定任务上磨砺多年的专业模型。

---

**一、为什么视频生成是视觉AI的"九阳神功"**

要理解这个想法的独到之处,先从一个问题入手:要生成一段逼真的视频,一个AI系统需要真正懂得什么?

以生成"一个人走进咖啡馆"这段视频为例。系统必须明白:推门而入的人,身体各部分之间的比例和运动规律;光线从窗户射进来,打在脸上、桌面上应该形成怎样的阴影;从一帧到下一帧,人的位置怎么移动、背景怎么保持不动;桌子在远处时看起来比在近处小,这是透视规律……这一切,并没有人明确告诉AI,AI是通过不断尝试生成视频、让结果尽可能真实,自己悟出来的。

换句话说,**一个足够强大的视频生成模型,实际上已经在内部建立了一套对物理世界的深刻理解**:三维几何结构、物体的运动规律、光照与阴影、物体随时间的持久存在。这些,恰恰都是视觉感知任务所需要的底层知识。

研究团队认为,一个好的视觉预训练范式应该满足三个核心条件。第一,它要让模型真正理解"时空演化"——世界是四维的(三维空间加上时间),模型必须学会时间上的因果关系和物理规律。第二,它要实现"视觉与语言的原生对齐"——因为现代视频生成模型本来就是根据文字描述来生成视频的,视觉特征和语言含义天然地绑定在一起。第三,它必须能够大规模扩展——视频生成模型因为商业价值巨大,各大公司已经投入了海量数据和计算资源来训练它,这种规模效应可以直接继承。

以前流行的视觉预训练方式,比如"遮住图片的一部分让AI猜"(掩码自编码器),或者"让AI分辨哪两张图更相似"(对比学习),都在某一方面有所欠缺:前者缺少语言对齐,后者缺少时序理解,而且两者的规模都无法与视频生成相提并论。视频生成,则三条都满足了。

---

**二、GenCeption的"转型之路":从画家到侦探**

GenCeption的核心思路,可以用一个职业转型的故事来理解。

设想有一位极其优秀的写实画家,经过多年训练,他能把任何场景画得惟妙惟肖:人物的皮肤纹理、远山的层次感、光线在水面的反射……为了画好这一切,他不得不深入理解人体结构、透视规律、光影物理。某一天,这位画家转行做了法医侦探,需要看一张照片,判断凶案现场里物体之间的距离、人的姿势、光线来向。你会发现,他此前在绘画中积累的所有知识,此刻都成了破案的利器。GenCeption就是这么干的。

研究团队选用了一个已经训练好的开源视频生成模型——WAN 2.1,这个模型有1.3B(13亿)参数和14B(140亿)参数两个版本。这个模型的内部结构,是一种叫做"扩散变换器"(DiT,可以理解为视频生成的核心引擎)的架构,辅以负责压缩和还原图像的编码解码器,以及理解文字指令的文本编码器。

**把"迭代画家"变成"一步侦探"**

视频生成模型原本的工作方式,类似于一位画家反复修改草稿:从一张随机噪点图开始,经过50次迭代修改,逐渐去掉噪点,显现出清晰画面。这个过程很慢,而且每次修改都有随机性,不适合需要精确、快速的感知任务。

GenCeption做了一个关键改造:让这位"画家"跳过所有草稿阶段,直接给出答案。具体做法是,把输入视频直接送进模型(而不是送入随机噪点),并把时间步长固定为零(告诉模型"你已经完成了,这是最终状态"),然后只做一次前向计算,直接得到输出。这样,原本需要50步的慢速生成,变成了1步的快速感知。

这里有一个技术细节,值得用通俗方式解释一下。这个模型是用一种叫"整流流"(Rectified Flow)的方式训练的,它的输出实际上是"速度"(从噪点到清晰图像的变化方向)而不是直接的图像。研究团队发现,把这个"速度"取反,就能得到最接近目标输出的结果,而且这样做能让训练更快收敛、性能更好。可以把它类比为:模型本来告诉你"往东走能到达目的地的反方向",你把它翻转一下,就知道了正确的方向。

**用文字"遥控"感知任务**

GenCeption的另一大亮点,是用文字指令来切换输出模式。输入同一段视频,配上"输出:深度图",模型就给出深度估计;换成"输出:法线图",就给出表面法线估计;换成"输出:分割蒙版",就给出前景分割……整个过程就像用遥控器切换电视频道,同一台电视机,不同频道,不同内容。

这与以前的做法形成了鲜明对比。以前的多任务模型,通常需要为每个任务设计专门的模块、专门的损失函数,系统越来越复杂,任务之间的协调也越来越困难。GenCeption则把所有任务的差异,从"架构设计"层面转移到了"数据格式设计"层面——只要能把任务的输出用合适的方式表示成图像,就能加入这个统一系统。这个思路,和大语言模型统一处理各种语言任务的方式如出一辙。

---

**三、"万能输出格式":把什么都塞进三个颜色通道**

电脑屏幕上的所有图像,本质上都是由红、绿、蓝三个颜色通道(RGB)组成的。GenCeption的一个巧妙设计,是把各种感知任务的输出,统统转换成RGB格式来处理。

深度图(表示远近距离)本来只有一个数值,就把这个数值复制三份填入红绿蓝三个通道。表面法线图(表示物体表面朝向)本来有三个维度的数值,恰好对应红绿蓝三个通道。密集姿态估计(表示人体各部位的位置)同样是三维的,也直接映射进去。

更有意思的是相机姿态估计的处理方式。相机的姿态通常用矩阵来表示,维度远超三个通道。研究团队发明了一种叫做"Rothko射线图"(Rothko Raymap)的表示方式——名字来源于美国抽象画家罗斯科的色块风格。做法是:把画面空间分成几个区域,中间区域存放相机的平移信息(射线起点),周边区域存放相机的旋转信息(射线方向),就像把一幅建筑平面图和立面图拼贴在同一张纸上,从而用一张三通道图像表达了原本需要六个通道的信息。这种"把高维信息折叠进图像格"的思路,被研究团队称为视觉版的"把非文字信息转成文字字符串"——正如大语言模型把一切信息都转成文本来处理,GenCeption把一切信息都转成图像来处理。

**应对需要坐标输出的任务:额外的"感知探针"**

不是所有任务都能优雅地表示成图像。比如估计人体关键点的三维坐标(手腕在哪里、膝盖在哪里),需要输出的是一串数字,而不是一张图。对此,研究团队设计了一种轻量级扩展:在视频的每一帧对应位置,额外插入一个可以学习的"探针标记",模型处理完整段视频后,这些探针会携带该帧的语义信息,再经过一个简单的多层感知机(MLP,可以理解为一个小型转换器)解码出坐标数值。这些探针的位置编码经过特别设计,与原有模型兼容,不破坏模型原有的注意力机制。

---

**四、"合成厨房":用虚拟数据喂出真实能力**

现实世界的视频数据有一个大麻烦:真实视频很难同时配备深度、法线、分割蒙版、三维关键点等所有标注。收集这样的多模态标注数据,既费钱又费时。GenCeption的解决方案是:**自己用电脑动画软件"合成"训练数据**。

研究团队使用了800个来自RenderPeople数据库的三维人体模型,用200段来自卡内基梅隆大学动作捕捉数据库的真实运动数据为这些模型做动画,配以各种三维场景和HDRI(高动态范围)背景,以及不同的焦距、相机位置和运动轨迹,最终用Blender这款开源三维软件渲染生成了7500段视频。这些视频在渲染时,可以同时输出深度图、法线图、分割蒙版等所有需要的标注,相当于一次拍摄,所有角度同时拍清楚。

这批合成数据,还混入了若干公开的合成数据集(TartanAir、Virtual KITTI、MVS Synth)来补充深度和相机轨迹数据的多样性。对于表达引导分割任务,由于现成真实数据容易获取,则直接使用了MeViS、Ref-COCO和YouTube-VOS等真实数据集。

**统一损失函数:告别"多科室会诊"的混乱**

传统多任务学习还有一个工程上的大麻烦:不同任务需要不同的损失函数(衡量预测结果与真实结果差距的数学公式),深度估计要用尺度不变损失,法线估计要用角度损失,分割要用交叉熵损失……每次加入新任务,就要重新调整各个损失函数的权重,反复试错,耗费大量人力。

GenCeption采用了一个更简洁的方案:所有任务统一使用最普通的L2损失(就是预测值与真实值差的平方)。但问题来了,深度估计这种任务有"尺度歧义"——同一张图,深度值可以是1米到10米,也可以是10米到100米,预测出来的结果难以统一比较。解决方案不是改损失函数,而是在数据层面做处理:把每段视频的深度图,用该场景的中位深度做归一化,再用一个非线性函数映射到0到1的范围。这样,所有任务的输出都在相同量级,用同一个L2损失就能一起训练。任务间的权衡,只需调整数据混合比例,就像调整一道菜里各种食材的比例一样直观。

**训练细节:稳定是第一要务**

训练在256块谷歌v6e TPU(一种专为AI训练设计的芯片)上进行,批量大小64,学习率5×10??,共训练15000步,前250步做线性预热。为了保持训练稳定,研究团队使用了两种保险机制:梯度裁剪(当梯度太大时自动压缩)和梯度丢弃(当某批数据的梯度异常时直接跳过),这两个措施被描述为"对稳定训练和高质量性能至关重要"。

---

**五、考试成绩单:在多个科目同时拿高分**

研究团队在一系列标准测试数据集上,把GenCeption与各领域的顶尖专业模型进行了对比,涵盖表面法线估计、深度估计、相机姿态估计、前景分割、表达引导分割和三维人体关键点估计六大类任务。

在表面法线估计方面,GenCeption的大型版本(14B参数)在Sintel数据集上的平均角误差为29.3度,超过了专门做法线估计的NormalCrafter(30.7度)和Lotus-2(30.3度),在Hi4D数据集上的误差(11.47)也好于Sapiens(12.14)和David(15.37)。

在深度估计方面,这套方法在KITTI数据集上的相对误差达到0.048,与专门做深度估计的顶尖模型D4RT(0.055)和VGGT-Ω(0.041)处于同一量级,而且训练数据量比它们少7到500倍。更具体地说:D4RT使用了约86M(8600万)帧训练数据,VGGT-Ω使用了约600M(6亿)帧,而GenCeption只用了1.23M(123万)帧,却能达到接近的水平。

在相机姿态估计(判断拍摄时相机在哪里、朝哪里)方面,GenCeption的平均位移误差为0.156,优于MapAnything(0.306)、VGGT(0.247)和DepthAnything3(0.201),与D4RT(0.148)和VGGT-Ω(0.145)的差距很小。

在前景分割(把画面中的主体从背景中分离出来)方面,GenCeption在VideoMatte数据集上的均方误差为0.0018,在PhotoMatte上为0.0008,与专门做视频抠图的RVM模型(0.0010)接近,还好于MODNet(0.0054)。

在表达引导分割(根据"黄色毛衣""从左边开来的白色面包车"这样的语言描述,找到并分割对应物体)方面,GenCeption的J&F分数在MeViS数据集上达到69.0,超过了SAM3(41.3)和SAM3加Gemini的组合(64.5),与专门为此设计的ReferEverything(60.3)和VoCap(51.9)相比也有明显优势。

在三维人体关键点估计方面,GenCeption的大型版本在EMDB数据集上的MPJPE(每关节平均位置误差,单位毫米,越小越好)为71.8毫米,优于GVHMR(72.6)、Genmo(73.0)和TRAM(74.4)。

**与其他预训练方式的正面较量**

一个关键的对照实验,是在完全相同的训练数据下,比较不同预训练方式的效果。研究团队分别用V-JEPA(一种视频特征预测方法)、VideoMAE V2(视频掩码自编码器)和WAN 2.1(视频扩散生成模型,即GenCeption所用)的预训练骨干,在同样的7500段合成视频上微调,测试深度估计性能。结果显示,V-JEPA在Sintel上的相对误差高达0.422,VideoMAE V2(最大版本)为0.260,而WAN 2.1的1.3B版本已经降至0.201,14B版本进一步降至0.181。生成式扩散预训练对感知任务的帮助,远超现有的判别式预训练方法。

研究团队还做了一个"从多少层开始预训练有意义"的实验:分别把DiT的0层、8层、16层、24层、32层和全部40层的预训练权重迁移过来,从头训练其余层。结果非常清晰:完全从零开始训练(0层预训练权重),训练损失曲线几乎是一条水平线,几乎学不到东西;随着迁移的预训练层数增多,收敛速度越来越快,最终性能越来越好。这有力地证明了预训练权重对下游任务的核心价值。

**推理速度:已经足够实用**

由于去掉了原本的50步迭代,GenCeption的推理速度相当实用。在单块v6e TPU上处理一段81帧、480×832分辨率的视频,1.3B版本需要5.92秒,帧率约13.6帧/秒(其中核心DiT网络只需0.96秒),占用约15.3GB显存;14B版本需要10.03秒,帧率约8.0帧/秒(核心DiT需5.11秒),占用约42.8GB显存。两个版本共享的文本编码器需要10GB,VAE编码解码器需要0.25GB,都可以卸载到系统内存以节省显存。

---

**六、超出预期的"意外收获":三种让人惊喜的泛化能力**

GenCeption最令研究者兴奋的地方,或许不是那些量化指标,而是一系列完全出乎意料的泛化现象。

**从合成跳到真实**

整套系统几乎完全在电脑合成的虚拟视频上训练,却能直接用于真实世界的视频,而且效果出色。更有意思的是,模型输出的细节质量,有时甚至超过了用于训练的合成数据本身的质量——比如,对于真实视频中猫的胡须,模型能给出相当精细的法线估计;对于人的头发,能做出柔和自然的分割,而这种细腻程度在合成训练数据里根本没有出现过。这意味着,模型从视频生成预训练中学到的那些"世界知识",为它提供了超越训练数据的感知能力。

**从一个人跳到多个人**

训练数据里,每段视频只有一个人物。但在测试时,面对多个人同时出现的真实视频,模型能够同时对所有人进行正确的深度估计、姿态估计和分割,没有出现混淆或崩溃。这种泛化能力完全是自发涌现的,研究者并没有专门设计任何机制来实现它。

**从人类跳到动物和机器人**

训练数据清一色都是人类的视频,但模型对猫、狗、熊、狮子这些动物,以及机器人这类"非人类铰接式物体",同样能给出合理的姿态估计和分割结果。换句话说,模型似乎学到了"铰接式可运动物体"这个更抽象的概念,而不仅仅是"人类"这个具体类别。在表达引导分割的实验中,即便查询词是"火箭"(完全不在训练数据中),模型也能根据视觉和语言理解正确地把火箭分割出来。

研究团队认为,这些涌现行为的根源,正是视频生成预训练赋予模型的那些丰富表征,它们远比感知任务本身所需的知识更加宽泛和深厚。

---

**七、联合训练的"副作用":多面手的代价**

诚实地面对局限性,是好研究的标志之一。

当把所有任务放在一起联合训练时(形成"通才模型"),相比各任务单独训练("专才模型"),结果呈现出不均匀的变化。前景分割任务在联合训练下反而受益,性能小幅提升。深度估计在部分测试集上性能基本持平,在另一些测试集上略有下降。表面法线估计的表现在不同数据集上有涨有跌。

最显著的副作用出现在三维关键点估计上:联合训练会使这个任务的性能明显下降,同时拖累其他密集预测任务。研究团队分析认为,这源于两个根本矛盾:一方面,坐标数值预测是离散的、结构化的,与模型在预训练阶段所擅长的连续像素空间表示格格不入;另一方面,为稀疏任务额外引入的"探针标记"是从零开始随机初始化的,这些随机初始化的标记会干扰原本已经训练稳定的注意力机制,需要更多数据才能收敛,在数据有限时则会破坏其他任务的表现。

这一发现本身也是一种重要的洞察:在基于预训练模型做微调时,对模型架构的改动越少越好,或者反过来,如果任务确实需要很大的架构改动,那或许需要从预训练阶段就把这些需求纳入设计,而不是等到微调阶段再拼凑。

---

**这对我们意味着什么**

说到底,GenCeption代表的是一种思维方式的转变。过去,让机器"看懂"世界和让机器"画出"世界是两条完全不同的路。现在,谷歌DeepMind及合作机构的研究表明,这两条路其实是同一条路的两个方向:先走过"画出"这条路,积累了足够的世界知识,再回头走"看懂"这条路,反而走得更远、更稳。

对于普通人而言,这意味着未来的视觉AI助手可能会越来越像一位真正的"全科医生"——同一个系统,既能帮你测量照片里家具到墙的距离,又能识别视频里运动员的姿势,还能根据你的文字描述找到并标记特定物体。不同功能之间的切换,不再需要更换整套软件,只需要换一条文字指令。

当然,目前这套系统仍有未竟之处:通才版本相比各专才版本仍有差距,特别是在需要精确坐标输出的稀疏任务上。数据也还主要依赖合成,真实世界数据的多模态标注难题尚未彻底解决。但研究团队展示的数据和模型扩展规律表明,随着投入的数据量和模型规模增加,性能在稳步提升,这为未来的发展指明了方向。

假如视频生成模型的训练规模继续翻倍、再翻倍,那个内置了越来越完整的"世界物理模型"的生成骨干,所能赋予感知系统的能力边界,现在还很难预见。有兴趣追踪这一方向的读者,可以通过arXiv:2607.09024获取完整论文,项目主页genception.github.io也提供了更多演示视频。

---

Q&A

Q1:GenCeption和普通视频生成AI有什么不同?

A:视频生成AI(比如Sora)的目标是凭空创造出新视频。GenCeption则是把已经学会"画视频"的AI,改造成能"分析视频"的感知工具——输入一段真实视频,输出深度图、人体关键点、物体分割等理解结果。核心区别是一个"生产内容",一个"理解内容",但它们共享同一套对世界的底层知识。

Q2:用合成数据训练出来的模型,在真实视频上真的管用吗?

A:从GenCeption的实验来看,效果确实出乎意料地好。该模型完全用电脑渲染的虚拟人物视频训练,却在真实世界的人物、动物甚至机器人视频上都表现良好,有些细节的输出质量甚至超过了合成训练数据本身。研究者认为,这是因为视频生成预训练赋予了模型超越具体训练数据的抽象世界知识,使得从合成到真实的"迁移"能够自然发生。

Q3:GenCeption的"通才版本"比"专才版本"性能差多少?

A:差距因任务而异。在前景分割上,通才版本反而略好于专才版本。在深度估计和相机姿态估计上,通才版本在部分测试集上持平,在另一些测试集上略差一点。差距最大的是三维人体关键点估计,联合训练会明显拉低这个任务的表现。总体而言,通才版本在保持多数任务高水平的同时,个别任务存在一定代价。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-