
这项由南洋理工大学、快手科技Kolors团队和香港科技大学(广州)联合开展的研究,以预印本形式于2026年7月发表,论文编号为arXiv:2607.12000。有兴趣深入探究的读者可通过该编号检索完整论文。
你有没有遇到过这样的遗憾:在某个美丽的地方拍了一张照片,回家后却发现,如果当时换个角度站、多往前走几步,或者往右转个身,那个场景会更漂亮——但那一刻已经永远错过了。现在,AI研究者们正在试图用技术来弥补这种遗憾:只需给它一张照片,它就能"想象"出你站在另一个位置、朝着另一个方向看时,世界会是什么样子。
这件事听起来简单,实际上却难倒了一代又一代的计算机科学家。本文要介绍的,就是一个叫做**MetaView**的新方法,它在这个问题上迈出了迄今为止最具说服力的一步。
一、AI为什么会"看不懂空间"
要理解MetaView解决了什么难题,不妨先从一个常见的生活场景说起。当你闭上一只眼睛,用手捂住另一只眼,然后尝试估计桌上那个杯子离你有多远——你会发现这件事突然变得很难。这是因为人类大脑判断距离和空间关系,需要依赖双眼的协作(立体视差)、运动带来的视差变化,以及长期积累的生活经验。失去这些线索,空间感就会大打折扣。
对于AI来说,情况更糟糕。一张普通照片是二维的,它把三维世界"压扁"成了一个平面。照片里哪个东西近、哪个东西远、墙壁和地板的交界在哪里、椅子腿后面藏着什么——这些信息在拍照的那一刻就已经"丢失"了。要让AI从一张照片出发,生成另一个视角的画面,本质上是在让它凭空"猜测"被遮挡和未被拍到的部分,同时还要保证整个场景的空间关系是合理的。
现有的解决方案大体分为两派,各有各的困境。一派研究者选择让AI先把场景"建模"成一个三维结构,然后再从新的角度"渲染"出来。这就好比给AI一套积木,让它先把楼房搭出来,再从不同方向给楼房拍照。这种方式在视角变化不大的时候效果不错,但一旦视角变化太大,建模时遗漏的细节就会暴露出来,生成的画面会变得模糊、扭曲,甚至出现怪异的破洞。另一派则干脆抛弃了三维建模,直接让AI学习"看到什么镜头角度,就输出对应画面"的映射关系。这种方式更灵活,但AI对空间的理解始终是模糊的,就像一个从未学过地图的人试图按照"向右转大约走一段"的指示导航——方向感天生就不准。
MetaView的团队认为,这两派思路其实并不是非此即彼的对立,真正的解决方案在于找到两者的平衡点:既不要被繁琐的三维建模所束缚,也不要让AI在空间感方面完全"裸奔"。
二、一套聪明的"空间感知"配方
MetaView的核心思路,可以用一个厨师的比喻来理解。一个经验丰富的厨师不需要每次做菜都按照精确到克的食谱来操作,但他也绝对不会完全凭感觉乱来——他依赖的是多年积累下来的"手感"和"经验直觉",同时在关键节点上(比如加盐的量、火候的控制)还是会用工具辅助确认。MetaView对AI的处理方式与此异曲同工。
整个框架建立在一个叫做**Qwen-Image-Edit**的预训练图像生成模型上。这个模型本身已经非常擅长根据文字描述和参考图片生成高质量的新图像,可以把它理解为一个见过海量图片、具备丰富视觉"直觉"的AI画家。MetaView的工作不是从零开始训练一个新的AI,而是用一些精心设计的"附加模块"来扩展这位画家的能力,让它学会"在换了视角之后该怎么画"。
这套扩展方案由两个关键成分构成,就像给厨师增加了两件新厨具。
第一件厨具,是**从专业的几何感知网络里借来的"空间直觉"**。研究团队使用了一个叫做DepthAnything3的深度感知模型——这个模型本来的工作是从图片中估算每个像素点的距离(深度),但它在这个过程中积累了非常丰富的"场景理解能力"。MetaView不直接使用这个模型的输出结果(也就是深度图),而是提取它在处理图片时产生的**中间层特征**——那些还没有变成最终答案、但已经包含了大量空间关系信息的内部数据。这些特征被研究团队称为"隐式几何先验",可以理解为AI对场景空间关系的一种"内心感受",而不是精确的测量结果。
第二件厨具,是**用"真实距离"来锚定空间尺度**。这里需要解释一个AI生成领域的顽疾,叫做"尺度漂移"。设想你告诉一个AI"摄像机向前移动了1米",但AI对"1米"这个概念没有实际感受——它不知道这1米是在一个狭小的卫生间里还是在一个宽阔的广场上,结果生成的画面可能跑偏得面目全非。MetaView的解决方案是使用DepthAnything3的另一个版本(带度量深度估算的版本),它能估算出图片中每个物体到摄像机的真实物理距离,单位是真实的米。有了这个真实的距离信息,AI对"摄像机移动了多远"就有了真实的参照,不会再产生尺度漂移的问题。
三、如何把"空间感"注入AI画家的神经网络
上面说的两件"厨具"很有价值,但关键问题是:怎么把这些信息塞进一个已经训练好的复杂AI系统里,而不破坏它原有的"画功"?
MetaView选择了一种非常巧妙的非侵入式方案。研究团队把原有的Qwen-Image-Edit模型的所有参数都冻结起来——也就是说,这位AI画家原有的所有知识和技能原封不动,完全不改动。新增的功能通过一套**平行的注意力层**来实现,就像在画家旁边安排了一个新的"几何顾问助手",画家在作画过程中随时可以向这位助手请教空间关系,但画家本人的技法和风格完全保持不变。
具体来说,从DepthAnything3提取出的那些空间感知特征被压缩成一组"几何令牌"(可以理解为一张写满空间信息的便条)。在每一个生成步骤中,AI画家处理图像时,不仅会与原始图片的信息和文字描述互相"交流",还会同时与这张几何便条"交流"。研究团队可视化了这种交流过程,发现AI在生成目标视角画面时,给几何令牌分配的"注意力"远高于其他任何信息——这意味着几何先验在生成过程中确实发挥了至关重要的引导作用。
至于如何传达摄像机的位置和角度(即"从哪个方向看"),MetaView采用了一种叫做**空间感知旋转位置编码**的技术(改自PRoPE方法)。用更直白的话来说,这套编码方式让AI能够理解图像中每一个像素点在三维空间中的位置——它的横坐标、纵坐标,以及距离摄像机的深度(也就是Z轴)。把摄像机的内参矩阵(决定镜头视角大小的参数)和外参矩阵(决定摄像机在空间中位置和朝向的参数)都编码进这套位置系统里,AI就能在整个生成过程中时刻感知"我现在是在从哪个位置、朝哪个方向看这个场景"。
值得特别说明的是,整个训练过程中研究团队刻意回避了一件事:不做"深度提升",也就是不把深度图转换成三维点云或三维网格。这看起来好像是主动放弃了一些信息,但实际上正是这种克制避免了显式三维重建的种种局限性,保留了模型在面对复杂场景时的泛化能力。
四、为什么现有评价标准不够用,研究团队还发明了新指标
在介绍实验结果之前,有必要先聊一个很有意思的问题:怎么判断一张"新视角生成图"好不好?
传统上,研究者使用的评价指标包括PSNR(峰值信噪比)、SSIM(结构相似度)和LPIPS(感知相似度)。这些指标的共同逻辑是:把生成的图片和真实拍摄的对应视角图片逐像素比较,看看有多相似。在视角变化不大的情况下,这些指标基本靠谱。但当视角变化非常大时,问题就来了。
研究团队发现,当摄像机移动幅度很大时,生成画面中有相当一部分区域是原图中根本看不到的——AI需要"脑补"这些区域。对于这些脑补的部分,不同方法的结果可能看起来都不错,只是风格略有差异。然而,传统指标对图像的整体亮度分布和低频纹理非常敏感,一张画面模糊但亮度分布接近真实的图片,可能比一张画面清晰但视角略有偏差的图片得分更高——这明显和人眼的感受不一致。
为此,MetaView的团队提出了一个全新的评价指标,叫做**密集匹配距离(Dense Matching Distance,DMD)**。这个指标的思路是:与其比较像素值是否相似,不如比较图像中可识别的特征点是否落在了正确的空间位置。具体操作是用一个叫做UFM的密集特征匹配工具,在源图片、生成图片和真实目标图片之间建立点对点的对应关系,然后测量生成图片中的特征点和真实图片中对应点之间的平均位移距离。位移越小,说明生成的视角越准确;如果某些特征点在生成图中根本找不到对应(即遮挡或生成失败),则给予最大惩罚分数。
研究团队通过实验验证了这个新指标的优越性:对一组视角逐渐增大的图像序列,PSNR、SSIM和LPIPS都不能稳定地随视角增大而单调变化,而DMD能够准确地反映视角差异的大小,与人眼的直觉判断高度一致。这个新指标今后有望成为衡量视角合成能力的更可靠标准。
五、真刀真枪的对比:MetaView到底赢在哪里
研究团队在三个不同的数据集上进行了系统性测试,分别是室外大场景数据集DL3DV(包含超过10000个真实场景)、室内场景数据集RealEstate10K(真实房产视频)以及街景数据集Sekai-Real-Walking-HQ(真实街道行走视频)。
特别是在DL3DV数据集上,测试被细分为三个难度级别:容易级(源图和目标图重叠超过80%)、中等级(重叠50%-80%)和困难级(重叠30%-50%)。重叠比例越低,意味着视角变化越大,生成难度也越高。
与之对比的六个方法涵盖了两大流派:重建派包括ViewCrafter、Gen3C、PE-Field和Voyager,隐式生成派包括HY-World-1.5和Lingbot-World。
在容易级测试中,MetaView的PSNR得分为17.94,而排名第二的重建派方法ViewCrafter只有15.45,DMD指标MetaView仅为2.56,而最好的竞争对手Gen3C也有6.52——差距已经相当明显。
进入困难级测试,差距被进一步放大。MetaView的DMD指标为20.74,而ViewCrafter达到48.83,Gen3C也有41.07,HY-World-1.5为34.45。两个隐式生成派方法在所有难度下的表现都很糟糕,特别是DMD指标,Lingbot-World在困难级高达55.39。这印证了研究团队的判断:纯粹依赖摄像机姿态作为控制信号、没有空间尺度锚定的隐式方法,在视角变化较大时会产生严重的尺度漂移和方向失控。
在RealEstate10K和Sekai数据集上,MetaView同样取得了全面领先的结果。在Sekai数据集上,DMD指标MetaView为6.69,Gen3C为8.72,其余方法均在15以上。
从生成图片的直观质量来看,重建派方法在视角大幅变化时普遍出现了明显的模糊和扭曲,有些情况下甚至连基本的场景结构都无法正确还原。而MetaView生成的画面不仅视角准确,细节也保持了相当高的清晰度和一致性。
六、拆解每个零件:没有哪个设计是多余的
研究团队还专门做了消融实验,就是逐一把MetaView的每个组件拆掉,看看少了这个零件之后性能会怎么变化。
去掉几何令牌(隐式几何先验)之后,整体视角方向仍然基本正确,但画面中物体的相对空间关系开始出错:指示牌消失了,物体轮廓变得不准确,不同物体的前后关系也开始混乱。PSNR从14.21降到13.53,DMD从9.33升到11.61,数据和视觉观察都印证了几何先验的重要性。
去掉Z轴深度编码(即度量深度锚定)之后,视角的旋转方向仍然对,但位移出现了偏差——画面中的整体场景在空间中的位置"跑偏了",这正是尺度漂移的典型症状。PSNR从14.21骤降到12.49,DMD从9.33升到14.45,退化幅度比去掉几何令牌更为显著,说明尺度锚定对于精确的视角控制至关重要。
研究团队还测试了用另一个流行的基础模型FLUX.1-Kontext替换Qwen-Image-Edit的效果。结果发现,即便换了基础模型,MetaView的设计思路依然有效——在相同基础模型上,MetaView的各项指标全面优于同样使用FLUX.1-Kontext的PE-Field(竞争对手中的重建派代表),证明这套方法本身的有效性不依赖于特定的基础模型。
七、可以用在哪里,还有什么做不到
MetaView的一个重要特质是泛化能力强。由于基础模型的参数完全冻结,原始预训练数据中积累的丰富语义知识被完好保留。研究团队测试了大量训练集之外的场景,包括以人物为主角的场景、以动物为主角的场景,甚至包括卡通风格、水彩画风格和AI生成图像风格的内容——MetaView都能生成合理的新视角画面,跨域适应能力相当出色。
然而,这个方法也有其边界。在基础模型从未见过的复杂场景中,MetaView可能出现生成失败的情况,本质上是因为基础模型的语义先验中没有对应的"素材"。在视野极其开阔的远景场景中(比如从山顶俯瞰城市全景),由于深度估算本身的精度下降,MetaView的视角控制精度也会随之降低。此外,MetaView目前只能处理静态场景,对于包含运动物体的视频场景(比如街道上行驶的车辆、走路的人群),它还无法生成在时间维度上连贯一致的结果。研究团队表示,将来的工作方向之一是扩展到时空一致的动态场景生成。
归根结底,MetaView做的事情,是在"什么都不建模"和"什么都精确重建"这两个极端之间找到了一条更明智的中间路径:只提供最关键的空间线索,把其余的创造工作交给已经具备丰富视觉经验的生成模型来完成。这种克制与放手的结合,恰恰是它能够在大视角变化下依然保持准确和流畅的核心原因。
对于每一个曾经遗憾"当时要是多走几步就好了"的摄影爱好者来说,这项研究预示着一个有趣的可能性——也许在不远的将来,错过的角度真的可以被"补回来"。
---
Q&A
Q1:MetaView生成新视角时需要提供什么信息?
A:MetaView需要三样东西:一张源图片、摄像机的内参矩阵(描述镜头视角大小的参数)以及目标视角相对于源图片的摄像机外参(描述新位置和朝向的参数)。相机参数可以通过VIPE等工具从视频中自动估算,不需要用户手动填写复杂的数字。
Q2:MetaView和传统三维重建方法有什么本质区别?
A:传统三维重建方法会先把场景转化为三维点云或网格结构,然后从新视角渲染。MetaView不做这一步,它通过"隐式几何先验"让AI内部感知空间关系,同时用度量深度锚定尺度,整个过程不依赖显式三维结构,因此在视角大幅变化时不会因为重建缺陷而出现明显的画面破损和扭曲。
Q3:DMD指标和PSNR、SSIM这些常见指标有什么不同?
A:PSNR和SSIM本质上是逐像素比较亮度和结构差异,容易被整体亮度分布影响,一张模糊但亮度对的图片可能得高分。DMD则是追踪图像中可识别的特征点在空间上的位移距离,直接衡量生成视角是否在正确的空间位置,与人眼对视角准确性的感知更为一致,对大视角变化场景的评估更加公正可靠。
好文章,需要你的鼓励
ARCHead是一种专门压缩大语言模型输出层的方法,通过量化低秩核心与激活度量修正,将LM-head存储压缩至BF16的约25%,质量损失极小。
这项研究发现AI投票推理在多答案问题上会系统性失效,提出用因果数学规则直接验证候选答案的CALVER方法,准确率比投票提升约11至19个百分点,且差距随尝试次数持续扩大。
这项来自港科大与腾讯视频的研究提出WorldCycle框架,通过可逆动作循环构造无标注自验证奖励,将视频世界模型的长程漂移误差降低最高44%,复合动作准确率提升约四倍。
哥本哈根大学团队构建了首个同时覆盖三种引用粒度、屏蔽信息泄露、包含全量段落候选库的法律信息检索数据集LegalPincite,用于评估法律判决段落精确检索任务。