
这项由清华大学、北航大学、武汉大学与Insta360 Research共同主导的研究,以预印本形式于2026年7月9日发布,论文编号为arXiv:2607.08765,有兴趣深入了解的读者可以通过该编号查询完整论文。
全景图,简单来说就是你在手机里看到的那种可以360度旋转的沉浸式照片——上下左右都能看到,就像你站在房间中央四面张望一样。近几年,随着VR头显、虚拟旅游和数字孪生技术的普及,人们对"AI自动生成全景图"的需求爆炸式增长。你只需要打一段文字,比如"一个落日余晖下的热带海滩",AI就能给你生成一张360度的全景图,可以直接放进VR眼镜里欣赏。
然而,这件事远比听起来复杂。现有的AI画图工具,比如大家熟知的各种"文生图"模型,本质上是为普通的"平面照片"设计的。当你把它们强行用于生成全景图时,就好像用一把菜刀去雕刻精细的玉石,工具本身不合适,结果自然差强人意:生成的图左右两侧对不上、边界像被人用橡皮擦了一样模糊、空间感完全扭曲,更不用说在此基础上做什么"修改某个区域的内容"或"把照片风格换成油画"了。
这支研究团队提出了一个名为Canvas360的框架,试图从根本上解决这个问题。他们的核心思路是:与其让AI死记硬背全景图长什么样,不如先教会它"全景世界的空间是怎么运作的"——也就是说,先学几何原理,再学画图本领。
一、全景图到底难在哪里
要理解Canvas360解决了什么问题,得先明白全景图和普通照片的本质区别。普通照片就像你透过一扇窗户看到的景色,视角有限,边界分明。而全景图是把你周围所有方向的景色,强行"压扁"摊开成一张矩形图片——这种摊平方式在学术上叫做"等矩形投影"(Equirectangular Projection,简称ERP)。
这就带来了一个非常直观的问题:地球仪上的格陵兰岛看起来和非洲一样大,但实际上非洲比格陵兰岛大14倍。同样的道理,在ERP全景图里,靠近图片上下两端(对应现实中的天空和地面)的区域,会被极度拉伸和扭曲,而中间区域相对自然。AI模型如果没有专门学过这种"越靠近顶端越扭曲"的规律,生成出来的全景图就会充满奇怪的变形和不协调。
更棘手的是,全景图是一个"首尾相连"的图像——图片的最左侧和最右侧,在现实世界中其实是同一条线,也就是你站在原地正前方和正后方的交界处。如果AI在生成图片时,左边和右边的内容对不上,缝合处就会出现一条明显的"裂缝",整张全景图就废了。
除了生成质量,研究团队还想解决另一个挑战:不仅仅是从无到有"生成"一张全景图,而是能对已有的全景图进行各种操作——把它的风格换成水彩画,把其中某个物体抹掉,或者把一张普通照片扩展成全景图。这些操作统称为"上下文感知生成"(In-context Generation),意思是AI在工作时要参考用户给出的图片或指令,而不是凭空创作。
目前市面上已经有一些专门的全景图编辑工具,但它们要么只能做某一种操作(比如只能扩图),要么需要针对不同任务训练不同的AI模型,效率极低。研究团队的目标是:用一个统一的AI模型,同时搞定风格迁移、图像修复、扩图和编辑四大任务。
二、两阶段学习法,先学几何再学技艺
Canvas360的训练过程分成两个阶段,就像培养一名画家:第一阶段先教他透视学和解剖学(也就是几何原理),第二阶段再教他各种绘画风格和技法。
第一阶段叫做"几何感知预训练"。研究团队收集了10万张高质量的全景RGB照片,并为每张照片配上了对应的"深度图"。深度图是一种特殊的图像,它不记录颜色,只记录场景中每个位置距离相机的远近——越近的地方颜色越浅(或越深,取决于配色方案),越远的地方颜色越深(或越浅)。你可以把深度图理解为场景的"地形等高线图",只不过描述的是距离而非海拔。
为什么要用深度图?因为深度信息直接告诉AI哪里是前景、哪里是背景、空间如何分布,这正是AI在生成和编辑全景图时最容易搞错的地方。普通的平面图AI模型在学深度时,用的是从相机正前方拍摄的"笛卡尔坐标深度";而全景图的深度应该用"球面坐标"来表示,也就是物体距离球心(相机所在位置)的距离。这个区别虽然听起来像数学细节,但对于全景图的空间感来说至关重要。
研究团队借助一个叫做DAP的先进深度估计工具,专门针对全景图设计,把这10万张照片都配上了准确的深度信息。训练时,AI要同时生成RGB全景图和对应的深度图,两者一起学习,互相约束,就像同时练左右手,让两只手协调配合。
第三个核心设计叫做"速度循环填充"(Velocity Circular Padding)。前面提到,全景图的左右两侧其实是现实中的同一条线。早期的一些方法会简单地把图片的右边复制一份贴到左边(或反过来),让AI在训练时反复看到边界区域,以为增加训练次数就能解决边界不连续的问题。但研究团队发现,这种做法只是在增加边界区域的"作业量",并没有让AI真正明白左右两侧是相邻的。
他们的新方法不仅让边界两侧的图像内容互相参考,还让AI在预测图像变化趋势时,也同步考虑边界的连续性——就像告诉画家"你在纸的最右边画的这条线,要和最左边的线接上",而不是"你多练几次画右边的线"。
第四个设计叫做"相似度损失正则化"(Similarity Loss Regularization)。在同时训练RGB图像和深度图时,研究团队发现AI有时候会"偷懒",把两张图画得几乎一模一样,导致深度图失去了它本应有的独特性。为此,他们加入了一个"惩罚机制":如果AI预测出的RGB变化趋势和深度变化趋势太过相似,就扣分。这就像考试时告诉学生,数学答案和语文答案不能雷同,逼着AI真正分别思考两个不同的任务。
三、百万规模数据集,四大任务一网打尽
好的模型需要好的训练数据,而全景图领域的数据一直是老大难问题。研究团队为此专门构建了一个叫做Canvas360Dataset的数据集,规模达到惊人的100万样本,覆盖四种上下文感知生成任务。
这100万样本的基础是一个10万张全景图的"种子集",其中1万张来自著名的Matterport3D室内数据集,另外9万张是研究团队从互联网收集或使用先进生成模型生成的高质量全景图。在这10万张图的基础上,他们建立了一条自动化的数据生产流水线,生成了90万张针对四种下游任务的配对训练数据。
风格迁移数据的生产最为直接。研究团队使用FLUX.2-dev这款顶尖的图像生成模型,按照12种不同的风格(比如铅笔素描、油画、波普艺术等)将原始全景图进行风格转换,产生了20万对"原图-风格图"配对样本。为了保证质量,他们还对原图和风格图提取线稿,比较结构是否一致,删除结构差异过大的样本。
扩图数据的生成则利用了全景图本身的特性。研究团队随机模拟"相机参数"(包括朝向角度、俯仰角度、视角宽度、图像高宽),在全景图上截取一个对应的普通视角照片区域,然后把这个区域之外的部分遮黑,就形成了"用一张普通照片扩展成全景图"的训练对。这样生成了25万对扩图样本,涵盖各种角度和视野范围的情况。
图像修复数据参考了学术界经典的做法,在全景图上随机生成矩形遮挡区域,让AI学习把遮住的部分补全。研究团队还设计了两种不同的提示词模式:一种是描述整张全景图的全局提示词,另一种是专门描述被遮住区域内容的局部提示词。全局提示词配合大面积遮挡,局部提示词配合小面积精细遮挡,共产生了25万对修复样本。
编辑数据的生成最为精细。研究团队使用视觉语言模型(可以理解图像内容的AI)和物体检测工具,自动定位全景图中的各种物体,然后用FLUX.2生成"移除该物体后"的图像。这样就得到了"有物体的原图"和"移除物体后的图"这一对样本。反过来,这一对样本也可以用作"添加物体"任务的训练数据。对于小物体、复杂背景等难以处理的情况,团队还引入了谷歌的NanoBanana工具进行精细修复。整个编辑数据集共生产了20万对样本。
四、第二阶段微调,一个模型搞定四项任务
完成了第一阶段的几何原理学习之后,Canvas360进入第二阶段:把学到的空间感知能力迁移到实际的编辑任务上。
在这个阶段,深度图被抛开了。AI不再需要同时生成深度图,而是专注于根据用户提供的输入图像和文字指令,生成目标全景图。然而,第一阶段建立的几何空间感知能力已经被"刻"进了模型的参数里,成为一种隐性的先验知识,在处理全景图的空间结构时自然而然地发挥作用。
四种任务在技术上使用了统一的处理框架。无论是风格迁移(把原图转换风格)、图像修复(补全被遮住的区域)、扩图(扩展视野范围)还是编辑(移除或添加物体),AI都接收两类输入:一张"条件图"(对应任务的参考图,比如待修复的有缺口的全景图),以及一段文字描述。AI的任务是生成对应的"目标图"(完整且符合要求的全景图)。
这种统一设计让一个AI模型就能处理原本需要四个不同专业模型才能完成的任务,大大降低了部署成本,也使得模型可以在四种任务之间共享知识,互相借鉴。
五、实验结果:全景专项指标大幅领先
研究团队在多个指标上与同类方法进行了全面对比,竞争对手包括PanFusion、SMGD、PAR、WorldGen、LayerPano3D、HunyuanWorld和DiT360等当前最先进的全景图生成系统。
评估指标本身也值得解释一番。FID(Fréchet Inception Distance)是衡量AI生成图像与真实图像整体分布差异的指标,分数越低越好。但这个指标是用普通平面图像训练出来的,对全景图的特殊性不够敏感。因此研究团队还额外使用了FAED(Fréchet Auto-Encoder Distance),这是专门为全景图设计的同类指标,更能反映全景图质量的真实水平。此外还有IS(多样性评分)、CS(文字与图像的匹配程度)、以及几个感知质量评分。
在Canvas360最看重的FAED指标上,Canvas360以2.33分的成绩明显优于所有对手,而第二名DiT360和HunyuanWorld均为2.91分。在感知多样性(IS)和美学评分(QA aesthetic)上,Canvas360同样拿到了最高分。在边界连续性这一全景图特有挑战上,研究团队通过专门的左右边界一致性指标(LRCE-RGB)进行测量,Canvas360以0.0063的超低分数(分数越低越好)遥遥领先,相比第二名DiT360的0.0101有接近40%的改善,意味着左右边界几乎感觉不到接缝。
在四个下游任务的表现上,Canvas360同样全面领先。以图像修复为例,Canvas360在感知相似度(LPIPS)、全景图特定保真度(FAED)和像素重建精度(PSNR)三个指标上均优于FLUX.1-Fill-dev、PAR和PanoDiffusion三个竞争对手。扩图任务的结果类似,三项指标全面最优。编辑任务的对比更为全面,Canvas360与FLUX.1-Kontext-dev、FLUX.2-dev、NanoBanana以及专门的全景编辑系统SE360和Omni2相比,同样在三项指标上均排名第一。
风格迁移任务的评估采用了三个维度:内容保留度(CP)、风格相似度(SR)和整体视觉质量(OV)。Canvas360在内容保留度和整体视觉质量上排名第一,风格相似度上略低于FLUX.2-dev但仍处于竞争力水平,这说明Canvas360在忠实还原全景图空间结构的同时,也能做到有效的风格转换,而不是为了追求风格而破坏原始内容。
六、人类评审员也买账:用户研究结果
定量指标的优势固然重要,但最终判断图像好不好看的还是人类的眼睛。研究团队邀请了71名参与者进行盲评(他们不知道每张图是哪个系统生成的),从文字匹配度、边界连续性、全景感知度和整体质量四个维度进行评分。
结果显示,Canvas360在边界连续性、全景感知度和整体质量三个维度上均获得了最高的用户偏好比例,分别为31.1%、34.1%和35.9%。在文字匹配度上,Canvas360以26.2%排在第二(第一是HunyuanWorld的26.9%,差距极小)。这些数据说明Canvas360不仅在机器评分上领先,在真实人类用户的感知体验上也更受欢迎。
七、拆解实验:每个设计都有用吗
为了验证每个创新设计的必要性,研究团队进行了细致的消融实验,也就是依次拆掉某个设计组件,看看性能会下降多少。
基础模型(不加任何新设计,直接在FLUX.1-dev上微调)的FAED得分为5.37。加入深度图并行训练之后,FAED降至4.74,说明深度信息确实提供了有价值的几何引导。但与此同时,视觉质量评分(QAqua和QAae)出现了下滑,还偶尔出现图像过暗甚至接近纯黑的失败案例,说明单纯加深度图会导致训练不稳定。
加入位置偏移(让RGB和深度的位置编码分开,互不干扰)之后,QAae从3.41跳升到4.13,证明两个通道的信息需要明确隔离,不然AI会混淆它们的含义,导致出现奇怪的视觉效果。再加入相似度损失正则化(防止两个通道变得太相似)之后,QAqua和QAae进一步提升到4.71和4.20,接近所有消融变体中的最优水平,说明防止两个模态"同质化"对于生成清晰稳定的图像至关重要。
速度循环填充的实验也很直观:把全景图旋转180度之后(这样原本在中间的边界就变成了明显可见的缝合线),使用普通循环填充的版本仍然能看到一条清晰的接缝,而使用速度循环填充的版本则几乎看不出来。
八、还存在哪些不足
研究团队在论文中坦承了Canvas360的局限性。目前,训练数据在场景类型上存在不平衡,某些类别的高质量全景数据较为稀缺。因此,当遇到需要生成高分辨率人脸,或者在严重扭曲的ERP区域(比如天空和地面交界处)显示文字招牌时,Canvas360的表现相对较弱。这是因为人脸和文字对精细度要求极高,而全景图的极端扭曲区域会把这些细节拉伸到难以辨认的程度,现有的训练数据还不足以让模型完全掌握这类极端情况的处理方式。
研究团队计划在未来继续扩充和平衡数据集,专门针对这类难度较大的场景类型增加高质量训练样本,以提升模型在罕见场景和严重几何畸变区域的鲁棒性。
归根结底,Canvas360做的事情是把"教会AI理解球形空间的几何规律"和"让AI执行具体的全景图编辑任务"这两件事分开来做,先打好几何基础,再学习应用技能。这种思路在普通平面图像领域其实早就被验证过,但在全景图领域,研究团队是第一次系统性地将其落地实施,并配套建立了百万规模的专用数据集。
这项工作对于VR内容创作者、游戏场景设计师、虚拟旅游开发者,乃至普通用户使用全景相机拍摄照片后进行后期处理,都有切实的应用价值。当然,研究团队也提醒,任何强大的图像生成技术都存在被滥用于虚假场景制造的风险,他们建议使用者在敏感场景下配合水印标注、来源追踪等手段负责任地使用。
有兴趣进一步了解技术细节的读者,可以通过arXiv编号2607.08765查阅完整论文,研究团队也在GitHub上开放了项目主页(https://zry000.github.io/Canvas360/),提供更多可视化结果。
Q&A
Q1:Canvas360和普通AI绘图工具有什么本质区别?
A:Canvas360专门为360度全景图设计,它在训练时让AI同时学习色彩生成和空间深度信息,从而理解全景图特有的球形空间几何规律。普通AI绘图工具只针对普通平面照片训练,直接用于全景图会出现边界断裂、空间扭曲等明显问题。Canvas360还使用了速度循环填充技术,让全景图左右两侧真正无缝衔接。
Q2:Canvas360Dataset数据集是怎么制作出来的?
A:研究团队先收集了10万张高质量全景图作为基础,然后通过自动化流水线生成90万张配对训练数据。风格迁移数据通过AI转换12种艺术风格产生,扩图数据通过模拟随机相机角度截取并遮挡产生,修复数据通过随机遮挡矩形区域产生,编辑数据通过AI自动定位物体后移除再配对产生,最终形成百万规模的专用数据集。
Q3:Canvas360在哪些实际场景中可以使用?
A:Canvas360可以用于VR内容制作(从文字生成沉浸式360度场景)、全景图风格转换(把真实照片转成油画或素描风格)、全景图修复(补全拍摄时被遮挡或缺失的区域)、全景图扩展(把手机普通照片扩展成360度全景)以及全景图编辑(移除或添加场景中的物体)等多种应用场景。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。