你有没有想过,跟AI聊几句天,就能把一个3D场景里的沙发换成别的样式,把恐龙骨架的头骨单独抠出来,甚至把整个背景变成梵高画风?
这事儿放在几年前,几乎是天方夜谭。3D场景编辑一直是个又苦又累的活,你得懂建模软件,得会调参数,改一个细节可能要折腾半天。而这篇论文讲的,就是研究者们怎么让一个大语言模型当"总指挥",指挥一堆视觉AI工具,帮你用大白话完成这些复杂操作。
先说说这事儿难在哪
如果你用过一些现有的3D场景编辑工具,可能会有一种很别扭的感觉:输入的文字必须严丝合缝地符合某种固定格式,多说一句少说一句,结果可能就完全不对。这背后的原因,其实和这些方法的技术架构有关。
目前主流的3D场景编辑技术,大体建立在两种表示方法上。一种是**NeRF**
NeRF:神经辐射场,一种用神经网络隐式表示三维场景的技术,输入视角坐标就能渲染出对应画面。
另一种是**高斯泼溅**
高斯泼溅:用大量三维高斯椭球来表示场景的几何和颜色,渲染速度比NeRF快得多的一种新技术。
这两种表示方法都很强大,但编辑起来却有个共同的麻烦:3D重建过程和2D图像编辑模型之间绑得太死了。论文里总结了三种典型做法。第一种叫迭代式,代表作是IN2N和Gaussian-Editor,需要把2D模型的编辑信息一遍遍塞回3D场景里重新训练。第二种叫监督式,靠2D模型给3D重建过程当"老师"打分。第三种叫去噪式,比如DN2N,得先给不同视角之间因为2D编辑产生的不一致效果建模去噪。
这三种做法听起来都挺合理,但它们有个共同的代价:想换一个2D编辑模型,往往意味着整个流程要推倒重来。
这就好比你家装修时,把水管、电线、承重墙全部焊死浇筑在一起。想换个热水器?对不起,得把墙砸开重新布线。如果不这样设计会怎样?如果水电是模块化、可拆卸的,换设备只需要拔插头这么简单。论文的作者们意识到,3D编辑领域一直没人做"模块化"这件事,这才是它没法灵活整合各种视觉工具、也没法用大语言模型来调度的根本原因。
于是他们干了一件挺聪明的事:把3D编辑和2D编辑彻底拆开,中间用一张"地图"来连接。这张地图,就是论文的第一个核心贡献,叫Hash-Atlas。
Hash-Atlas:如何把立体的世界拍扁成一张画
Hash-Atlas的思路说起来不难理解:把一个3D或4D场景的所有视角,都投影映射到两张2D平面图上,一张管前景,一张管背景。这两张图叫做"图集"
图集(Atlas):把三维场景的多个视角信息汇总压缩成的一张或几张二维图像,编辑这张图就相当于编辑了整个三维场景。
编辑操作全部在这两张2D图上完成,改完之后再用同一套映射关系,把编辑结果"贴"回原来的每个视角画面里。这个设计带来的好处非常直接:只要是能处理普通2D图片的模型,不管是抠图、上色、风格迁移还是超分辨率,理论上都能直接拿来用,不需要专门为3D场景做改造。
这有点像什么?想象你是个地图测绘员,要给一座山的所有侧面都画上装饰图案。传统做法是你得爬到山的每一面,一处一处地画,画完还要保证各个面之间衔接自然。但如果你能把这座山展开成一张平面的"山皮",在这张平面图上画完图案,再把这张皮重新包回山上,效率是不是高多了?如果不做这个展开映射,你就得为每个视角单独设计编辑逻辑,编辑一次可能要重新训练一次3D模型,慢且麻烦。
要实现这个"拍扁"操作,论文用了一个基于哈希结构的神经网络。具体来说,场景里某个点P(包含横纵坐标和所在的视角编号)会被一个叫Fm的函数映射成两组UV坐标,外加一个透明度参数α,这个α决定了这个像素点在前景图里占多大权重。然后另一个函数Fh,会根据这两组UV坐标预测出对应的RGB颜色值,分别对应前景图集和背景图集里的像素。最终某个点的真实颜色,就是前景颜色乘以α加上背景颜色乘以(1-α)。
这里面用到的哈希结构,其实借鉴了此前一种叫Instant-NGP的多分辨率哈希编码技术,好处是训练和推理速度都特别快。论文测下来,相比之前一种叫LNA(Layered Neural Atlases)的类似技术,Hash-Atlas在PSNR(衡量图像重建质量的指标,数值越高越好)上提升了1.1到5.1分贝,训练速度快了14到18倍,推理帧率提高了7到9倍。这不是一点点优化,这是把原本要跑十几个小时的训练,压缩到不到一小时。
为了让这张"拍扁的地图"足够精细可靠,论文设计了好几种损失函数来约束训练过程。前期训练时,会先用一个位置损失,让第一视角的坐标映射尽量保持原位,避免图集里出现过度扭曲。同时用一个VQA模型(能看图回答问题的视觉语言模型)和分割模型先判断出场景里什么是前景,再用这个信息去训练透明度α,让前景和背景的内容能干净地分离开。
最容易被忽略、但其实很关键的一个问题是背景缺失。当前景物体被从视角里"抠"出去后,背景图集里对应位置往往是空的,会留下明显的破洞。为了解决这个问题,研究者们借助了一个叫ProPainter的视频修复模型,先把这些被遮挡的背景区域预先补全,再用补全后的画面去监督图集的重建训练,这样修出来的背景图集才不会缺胳膊少腿。
从静态到动态:给移动的物体多上一道保险
如果场景里的东西是动的(比如视频里走动的人、飘动的气球),事情就变得更棘手了。论文的前身工作只处理静态3D场景,这次的升级版专门针对4D动态场景加了一道新的约束,叫Pivot Motion Loss(枢轴运动损失)。
问题出在哪呢?如果直接把处理静态场景的方法搬来处理动态物体,图集里的物体会因为运动产生严重的扭曲和信息丢失。研究者们的解决办法是:先从所有视角里挑出物体可见面积最大的那一帧,作为"枢轴视角",用它来初始化物体在图集里的位置。然后在这个枢轴视角里均匀采样若干个关键点,用一个叫CoTracker3的点追踪模型,去跟踪这些点在枢轴视角前后帧里的位置变化。最后设计一个损失函数,强制要求同一个关键点在不同帧里追踪到的位置,都映射到图集上的同一个坐标。
这就像给一群不断跑动的舞者拍集体照。如果你只拍一张照片就想还原出每个人完整的样貌,可能有的人转身、有的人被挡住,信息残缺不全。但如果你先找一个所有舞者都露脸最全的瞬间当参照,再持续追踪每个人的关键部位(比如头顶、手肘)在前后几秒里怎么移动,就能拼出一幅动态又完整的画像。实验数据显示,加了这道运动损失约束后,PSNR从28.22提升到28.61,虽然听起来提升不算夸张,但对应到画面效果上,是明显减少了追踪不一致导致的图集撕裂和错位。
图集编辑不能各扫门前雪:合并再拆分的策略
拿到了前景和背景两张干净的图集后,是不是直接分别编辑就完事了?论文里给出了一个很朴素但重要的观察:不行。
原因在于单独一张图集包含的场景信息是不完整的,尤其是前景图集,往往很稀疏,只有物体本身的像素,周围一片空白。这种残缺的信息会让视觉模型看不懂场景的整体语义,导致编辑结果驴唇不对马嘴。于是论文设计了一套"合并再拆分"的策略:先靠大语言模型和VQA模型判断这次编辑到底涉及前景还是背景。如果只改背景,就直接在背景图集上操作;如果涉及前景物体,就把前景图集叠加到背景图集上,形成一张信息完整的合成图,在这张合成图上编辑,编辑完之后再用原本的前景蒙版和新生成的物体蒙版,把改完的图重新拆分成前景和背景两张。
这个过程被称作"Executor"(执行器)。消融实验显示,如果去掉这个合并拆分的机制,直接对两张图集分别编辑,确实会因为信息不全导致错误的编辑结果,比如论文里提到的"把电视换成红花油画"的例子,没有Executor的版本要么编辑失败,要么效果完全跑偏。
让大语言模型学会"看菜下饭":CE3D++对话系统
有了图集这套底层机制,剩下的问题是怎么让用户用大白话指挥这一切。这就是论文的第二个核心贡献,CE3D++对话系统。
整个系统的运转逻辑是这样的:用户输入一句话,大语言模型先琢磨"这句话需不需要调用视觉工具",如果需要,就继续想"该调哪个工具"以及"这个工具需要什么输入参数"。这个过程被设计成一套固定的推理格式,思考、行动、行动输入、观察结果,循环往复,直到判断不再需要工具,最后把结果组织成自然语言回复给用户。
这套系统面临一个很现实的问题:场景文件、图集文件、编辑结果文件全都是非文本的数据,大语言模型没法直接"看"到这些文件内容。研究者们的解法是给每个文件起一个形如"xxx.scn"的唯一编号字符串,这个编号本身没有实际含义,纯粹是给大语言模型当索引用。这样设计的关键作用是防止模型"编造"不存在的文件名,同时前端和后端会负责把这些编号和真实文件对应起来。消融实验里,去掉这套文件名管理机制后,模型要么给不出编辑结果,要么给出的文件名对不上真实文件,导致整个流程崩掉。
工具描述这块也有讲究。论文给每个视觉工具都标注了四类信息:工具叫什么名字、什么情况下该用它、需要哪些输入参数、以及一个具体的调用示例。这套设计思路,其实和此前的Visual-ChatGPT、MM-REACT等工作是一脉相承的,都是把大语言模型当成一个"调度中枢",让它去指挥一堆专业工具干活,而不是让语言模型自己去理解图像像素。
轻量级模型的补课:轨迹微调数据集
这里出现了一个很现实的矛盾。像ChatGPT这类大模型,处理这套复杂的工具调度任务表现相当不错。但如果换成参数量小、运行成本低的模型,比如8B参数的LLaMA或者14B参数的Qwen,问题就来了:随着可调用的视觉工具从20多种扩展到30多种,需要预先塞给模型的领域知识暴增,工具描述越来越复杂,模型调用工具的准确率反而开始下滑。而且在多步骤的编辑任务里,只要中间某一步判断错了,后面的步骤就会跟着全部出错,一步错步步错。
论文的解决方案是构建一个专门针对编辑任务的轨迹微调数据集,只有1000条对话样本,规模不算大,但设计得很精准,聚焦在工具属性、调度决策背后的推理逻辑、以及具体的决策过程上。用这批数据对Qwen-14B和LLaMA-8B做全参数微调后,效果提升相当明显。
具体数字是这样的:原始的Qwen-14B在100条复杂用户指令上的调用成功率大概是69%,微调后提升到了89%,整整高了20个百分点。这20个百分点意味着什么?意味着原本每处理10个复杂任务,就有3个会因为工具调用错误而失败,微调之后这个失败数降到了1个左右。论文还专门做了对照实验,试过用"少样本提示"(给模型看几个示例再让它做任务)这种更简单的办法,结果发现提升非常有限,只到76%左右。原因也不难理解:这套系统本身的提示词已经包含了海量的工具描述和系统指令,多轮对话又会不断拉长上下文,再塞进一堆少样本示例,反而容易让小模型注意力分散,顾此失彼。相比之下,轨迹微调是把这套调度策略直接刻进模型参数里,不依赖临时抱佛脚式的上下文提示,更适合低成本、本地化部署的场景。
论文还做了更细粒度的分析,按工具类型(理解类、生成类、增强类、条件编辑类)、输入输出结构(图生文、文生图、图生图等)、推理复杂度(简单、中等、困难)分别统计了失败率。结果很一致:越是复杂、需要拆解用户意图、串联多个工具、还要复用中间结果的困难任务,微调带来的改善越明显。困难任务的失败率从21%降到了10%,简单任务原本失败率就低,微调后干脆降到了0%。
这就好比培训一个新手厨师。你给他看几张菜谱图片(少样本提示),他可能记住怎么切土豆丝,但遇到一道需要先腌肉、再爆炒、最后勾芡的复杂菜,步骤一多他就手忙脚乱。但如果你让他实际跟着师傅完整地做过上千道菜(轨迹微调),这套"先做什么、再做什么"的肌肉记忆会刻在他的操作习惯里,遇到新菜也能触类旁通。如果不做轨迹微调,直接依赖模型的通用能力去应付几十种工具的调度,复杂任务的失败率会居高不下,这套系统在低成本场景下就没法用。
值得一提的是,微调后的模型面对训练数据里没见过的全新工具,依然保持了不错的调度准确率,说明这套数据集教给模型的不是死记硬背某几个工具的用法,而是一种可迁移的调度思路。
实际编辑效果和对比
论文里展示了不少实际的对话编辑案例。比如有一个12轮对话的例子:用户先问场景背景是什么,AI回答是一栋建筑;用户让它把建筑去掉,AI照做并生成新场景文件;用户又反悔说想换成小木屋而不是直接去掉,AI也顺利完成替换;接下来用户想给雕塑做艺术化处理但不想动雕塑本身,只改背景成梵高风格,AI依然准确执行;再往后甚至涉及深度图预测、参考图片风格迁移、根据深度图重新生成场景等一连串操作。整个过程里,AI对文件名的管理、对用户意图的理解、对多轮上下文的记忆,都表现得相当连贯。
在量化对比上,论文拿CE3D++和几种2025年前后发表的先进方法做了比较,包括3D编辑领域的EditSplat、RoMaP、DN2N,以及4D编辑领域的CTRL-D、Instruct-4DGS、Dynamic-eDiTor。对比指标包括CLIP相似度(衡量编辑结果和文本描述的匹配程度)、CLIP方向得分(衡量图像变化方向和文本变化方向的一致性)、编辑耗时、显存占用峰值。
结果显示,CE3D++在CLIP相似度上全面领先,比如在CE3D自建数据集上达到0.352,而对比方法里表现最好的RoMaP只有0.240。编辑速度上优势更明显:CE3D++处理一个场景平均只需要5.6到8.8分钟,而RoMaP需要21.5到24.9分钟,DN2N甚至要26.5到36.3分钟,快了三到六倍。之所以能这么快,很大程度上得益于图集这套机制不需要反复迭代训练3D或4D表示,编辑操作直接在2D图片上完成,效率自然高出一大截。
论文还专门对比了CE3D++和早期方法IN2N在文本查询多样性上的表现。同样是要做边缘检测这个操作,只是换了三种不同的说法("检测这个场景的边缘"、"帮我检测一下边缘"、"我想知道边缘长什么样"),IN2N给出的结果差异很大,说明它对文本表达的鲁棒性不足。而CE3D++因为背后有大语言模型做语义理解,三种说法都能得到基本一致的编辑效果。
局限性和留白
论文也坦诚地列出了几个还没解决的问题。整套系统高度依赖大语言模型对文本查询解析的准确性,也依赖外部视觉工具本身的表现上限,如果某个视觉工具本身效果不好,AI调度得再准也没用。
另外,图集这套机制目前更适合正面朝向、以物体为中心的场景。如果是360度环绕拍摄的场景,图集会出现严重的扭曲变形,而现有的2D视觉模型的训练数据里几乎没见过这种扭曲图集,容易导致编辑结果不合理。论文里给了个实例:想把一辆卡车改成红色轿车,360度场景下的图集扭曲导致这个编辑彻底失败,反而是改背景为水墨画风格这种低精度要求的操作能成功。
在动态场景里,如果物体发生剧烈的非刚性形变或者严重遮挡,CoTracker3这类追踪模型也可能跟丢目标,导致图集里出现明显的伪影瑕疵。
写在后面
读完这篇论文,最触动我的一点是,它其实解决的不是"能不能编辑3D场景"这个问题,2014年到2024年之间已经有大把方法能做到这一点。它解决的是"编辑3D场景这件事能不能变得像换个APP插件一样轻松"这个更底层的工程矛盾。
论文里那句"3D和2D编辑过程解耦"看着朴素,但细想一下,这背后其实是对整个领域长期存在的一个假设的挑战:大家默认3D重建和2D编辑必须紧密耦合才能保证质量,所以才会有那么多论文在研究怎么设计更精巧的耦合方式。而CE3D++的思路是反过来的,先想办法把耦合关系打断,再看打断之后能不能靠一个中间层(图集)把两边重新缝合起来。这种"先拆后合"的工程哲学,其实在很多领域都出现过,操作系统的分层架构、微服务的解耦设计,本质上都是同一种思路的变体。
论文里提到的轨迹微调数据集只用了1000条样本就让小模型的调度准确率提升了20个百分点,这个数字让我挺意外。通常我们对"数据驱动"的直觉是数据量越大越好,但这里恰恰说明,如果数据的针对性足够强,专门瞄准调度决策这个薄弱环节去设计,小数据集也能撬动很大的效果改善。这提醒我,堆数据不是唯一的路径,找准问题的关键切口可能比数据规模更重要。
360度场景下的失败案例也留下了一个挺值得追问的问题:图集表示法目前是为正面视角设计的,那如果未来想让这套系统真正通用化,处理环绕拍摄的场景,是应该改进图集的映射方式,还是应该专门训练一批适应扭曲图集的2D视觉模型?这两条路径的工程代价完全不同,也许是这个方向下一步该琢磨的事。
Q&A
Q1:Hash-Atlas是什么,它解决了什么问题?
A:Hash-Atlas是一种把3D或4D场景多个视角映射成2D前景背景图集的神经网络方法,它让3D场景编辑可以直接在2D平面图上完成,从而摆脱了2D编辑模型和3D重建过程必须紧密耦合的限制,兼容性和编辑效率都大幅提升。
Q2:CE3D++和以前的3D编辑方法比如IN2N相比有什么优势?
A:CE3D++依靠大语言模型解析用户的自由文本输入,对不同表达方式的鲁棒性更强,同时因为采用图集解耦架构,能兼容30多种视觉工具,编辑速度比IN2N等方法快数倍,还支持多轮连续对话式编辑。
Q3:轨迹微调数据集对小模型的效果提升有多大?
A:论文用1000条样本对Qwen-14B进行轨迹微调后,工具调用成功率从69%提升到89%,尤其在需要多步骤推理的困难任务上,失败率从21%降到了10%,效果非常明显。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
阿里团队提出DICS方法,通过评估图片、问题、答案三者的内在一致性给训练数据打分,结合自适应采样策略筛选高质量子集。仅用25%的LLaVA-1.5-665K数据训练即超越全量数据效果,并在600万样本规模验证下用不到四分之一数据逼近官方InternVL3-8B性能。