
你有没有想过,为什么用AI生成的海报图,你想把里面那只兔子挪个位置,几乎是不可能的事?
你打开PS想改一张设计稿里的文字,鼠标一点,那个文字层立刻被选中,可以拖动、可以改颜色、可以删除,背后的背景图完好无损。这是因为设计师从一开始就是按图层工作的,背景、主体、装饰、文字,各自待在自己的层里,互不干扰。
但AI生成的图片不是这样。
主流的文本生成图像模型,不管是Midjourney还是Stable Diffusion,吐出来的都是一张扁平的画布。像素排列得再精美,它们描述的也只是"这个位置该是什么颜色",而不是"这个区域是一只兔子,那个区域是月亮,它们之间有前后遮挡关系"。你想单独挑出那只兔子挪个位置,模型根本不知道"兔子"这个概念在图里对应哪些像素、被谁挡住了多少、挪走之后露出的应该是什么内容。
这就是这篇论文要解决的核心矛盾:生成模型很擅长"画出来",却完全不懂"怎么拼出来的"。
像素记录的是结果,图层记录的是过程
先说清楚这两者的区别有多大。
像素*:图像最基础的单位,每个像素记录一个颜色值,描述的是画面"看起来是什么样",而不涉及内容的语义结构。
一张扁平化的PNG图,本质上就是几百万个像素点按顺序排列。它可以告诉你"这个位置是红色",但没法告诉你"这个红色区域是一件衣服",更没法告诉你"这件衣服被一个人的手臂遮住了一部分,如果把手臂拿掉,衣服应该是完整的一件"。
而设计师工作时脑子里想的完全是另一套逻辑:这是背景层,这是主体人物层,这是装饰元素层,这是文字层,每一层都是一个独立的、完整的、可以单独操作的对象。这就是这篇论文提出的核心洞察,用论文里的话说:像素定义了图像如何被渲染,而图层定义了图像如何被创造、理解和编辑。
这句话听起来有点抽象,换个说法可能更好懂:一张扁平的图片就像一份直接端上桌的成品菜,你尝得出味道,但看不出用了哪几种食材、哪个步骤先放盐哪个步骤后放糖。而一份带图层的设计稿更像是厨房里没洗的备菜台,葱姜蒜、肉、调料分门别类摆着,你随时可以单独拿起某一份重新处理,而不影响其他部分。如果所有食材直接混合下锅端上桌(也就是只有扁平像素),你想单独把里面的姜丝挑出来重新切一遍,基本没有可能。
于是研究团队提出了一个叫UniWorld-Design的框架,核心思路就是把语义化的RGBA图层,作为生成、理解、编辑这三件事的最小单位。
RGBA*:一种图像表示方式,除了常见的红绿蓝三个颜色通道(RGB),额外增加一个Alpha通道,用来表示每个像素的透明度,从而支持"抠图"式的图层叠加。
这个框架里有两个模型。一个叫T2RGBA(文本生成透明素材),另一个叫I2L(图片拆解为图层)。这两个模型合起来,构成了一个从文字到图片、再从图片拆回可编辑图层的完整循环。
从零开始造一个透明素材:T2RGBA
先看第一个模型,T2RGBA,全称Text-to-RGBA。
它做的事情很直接:给一句话描述,比如"一只戴着水手帽的绿松石色鲸鱼",直接生成一张带透明背景的RGBA图片,而不是一张需要你再去抠图的普通照片。
这里有个技术上的巧妙之处。研究团队没有从零训练一个全新的模型来处理透明通道,而是在已有的图像自编码器基础上做了个"微创手术"。
自编码器(VAE)*:一种能把图片压缩成一小段数字编码,再从编码还原回图片的神经网络结构,是几乎所有主流图像生成模型的底层组件。
具体做法是,把编码器最开始那一层和解码器最后那一层,从处理三个颜色通道(RGB)扩展成处理四个通道(RGBA)。原来的RGB权重原样复制过来,新增的透明度通道的权重先设成零,解码器的透明度偏置项设成"完全不透明"。这样一来,改造完的模型起步状态就等同于原来的RGB模型,只是多了一个默认全不透明的透明度通道,之后再通过训练慢慢学会怎么正确地处理透明区域。
如果不这样做,直接从零训练一个RGBA模型会怎样?那意味着要放弃原来RGB模型已经学到的所有关于物体轮廓、光影质感的知识,相当于让一个已经会画画的人重新从拿笔开始学,浪费了大量已有的能力积累。而这种"渐进改造"的方式,更像是给一辆已经会开的车加装一个新功能模块,而不是把整辆车拆了重新造。
训练数据方面,团队用的是内部整理的一批"文字配透明图"的数据集,包括设计素材、抠好的主体图、矢量画转成的插画。透明图片占了训练数据的大多数,但也混入了一部分不透明的图片,防止模型"忘了"怎么处理正常图像。
训练完成之后,模型还要经历一套两阶段的优化流程:先做渐进式蒸馏来提速,再用一种叫DiffusionNFT的方法做强化训练来提质。这个流程我们后面统一讲,因为I2L也用了同一套。
在CLIP Score(一种衡量生成图像和文字描述匹配程度的指标)这个维度上,T2RGBA达到了33.03分,是所有对比模型里最高的,比LayerDiffuse高了13%,比OmniAlpha高了6.5%。不过在FID(衡量生成图和真实图分布相似度)和白底合成后的LPIPS(衡量图像细节相似度)这两个指标上,OmniAlpha表现更好。这说明T2RGBA更擅长"听懂你说的话",但在细节质感上还有提升空间。
拆解一张成品图:I2L怎么做到"拆得干净还能用"
第二个模型是整篇论文里更硬核的部分,叫I2L,Image-to-Layer。
它接收一张已经画好的成品图,加上一句全局指令(比如"把这张图拆成背景、元素和文字"),再加上针对每一层的具体描述,然后同时输出一组排好顺序的、完整的语义图层。
这里的关键词是"完整"。
多数现有的分割方法做的是"可见像素分割",也就是只把画面上肉眼看得见的部分抠出来。这样做有个大问题:如果你把某个遮挡物挪走,被遮住的地方就露出一个透明的洞,因为模型压根没学过那块被遮住的区域应该是什么样。
I2L要解决的正是这个问题。它学的不是"哪里能看见什么",而是"这个物体完整的样子是什么",即便这个物体有一部分被别的东西挡住了。论文管这个叫语义完整图层,而不是可见像素分区。
打个比方,这就像给一栋房子拍照和给房子画建筑图纸的区别。拍照只能记录你镜头前看到的那一面墙,墙后面藏着什么完全不知道;而建筑图纸会把每一层楼、每一根承重柱的完整结构都画出来,哪怕现在被墙面装饰挡住了。等你哪天想拆掉一面墙看看内部结构,有图纸的房子随时能查,只有照片的房子就只能瞎猜。如果I2L也只学"可见分割"这一套,那么用户挪走一个遮挡物之后,看到的就永远是一个不明不白的透明窟窿。
要实现这个目标,光靠数据和模型规模堆不出来,还得解决两个结构性的对应难题。
第一个难题是,每一句针对某一层的描述,必须精确控制住"它对应的那一层",而不能影响到整个图层堆栈的其他部分。第二个难题是,不同图层的图像token(模型内部表示图像信息的基本单元)必须共享同一个画布坐标系,同时又要保持各自独立的身份和先后顺序。
Token*:模型处理信息时切分出的最小单元,图像token对应图片中的一小块区域,文本token对应一个词或字。
为了解决这两个问题,研究团队设计了一套叫LIB-MMDiT(Layer–Instruction Binding MMDiT)的架构,中文可以理解为"图层指令绑定的多模态扩散Transformer"。
它包含两个机制。第一个叫图层指令绑定注意力,做法是给全局指令和整张输入图打上标签-1,给每一层专属的描述和对应的图层图像打上编号i(i是第几层)。这样,某一层的图像在"读取"文字信息时,只能读到全局指令和自己专属的描述,读不到别的层的描述。但图像和图像之间的关注是完全开放的,这样才能让所有图层共同判断彼此的遮挡和堆叠关系。
第二个机制叫图层索引的三维旋转位置编码,简单说就是给每个图像token除了原本的行、列坐标,再加一个"层号"坐标,让模型知道同样位置的一个点,在不同图层里是同一个画布位置,但属于不同的层。
这套设计的效果,从数据上看很明显。
在Crello这个基准测试集上,I2L和目前另一个先进模型Qwen-Image-Layered对比,在每层RGB内容的还原误差上降低了37%(从0.2014降到0.1264),在透明度区域的匹配精度Alpha Soft IoU上提升了34%(从0.5454提升到0.7325)。
| 方法 | RGB L1误差(越低越好) | Alpha Soft IoU(越高越好) |
|---|---|---|
| Qwen-Image-Layered(4层) | 0.2014 | 0.5454 |
| **UniWorld-I2L(4层)** | **0.1264** | **0.7325** |
在可编辑性指标上,I2L生成的"空白图层"比例下降了63%(从0.35降到0.13),"糊状半透明层"(那种既不干净也不能单独用的层)从1.34降到1.19。
| 方法 | 坏图层数量 | 空白层 | 糊状层 | 内容差异度 |
|---|---|---|---|---|
| Qwen-Image-Layered(4层) | 1.69(占42.3%) | 0.35 | 1.34 | 0.658 |
| **UniWorld-I2L(4层)** | **1.32(占33.0%)** | **0.13** | **1.19** | **0.690** |
还有一组用大语言模型(VLM)打分的评测,从五个维度给拆解结果评分,满分25分。I2L拿到20.43分,Qwen-Image-Layered拿到17.60分。
在这五个维度里,I2L在语义分离度、背景修补、内容分布、内容有效性这四项上都更强,唯独在Alpha清洁度(也就是透明边缘是否干净,没有色彩残留和光晕)上略逊一筹(2.90对3.33)。论文也坦诚承认了这一点,把边缘处理和密集文字识别列为当前的主要局限。
拆完还能再拆一次:指令驱动的递归分解
I2L不只是"拆一次就完事",它支持一种叫指令可寻址的操作方式。
具体来说有三种玩法。
第一种叫顶层分解,就是把一张完整图片按你说的语义类别拆成几层,比如"背景、主体、设计元素、文字"。
第二种叫递归分解,也就是把拆出来的某一层再拿去当输入,进一步细分。比如第一轮拆出了"主体"这一层,里面其实包含了一个人和一只鹦鹉,第二轮就可以再拆一次,把人和鹦鹉分开。
第三种叫目标提取,直接告诉模型"我只要这几个特定元素单独成层,剩下的合并成一层"。
论文里给了大量的实际案例,比如输入一张写着"中秋"字样的月亮海报,第一轮指令是"把这张图拆成背景、元素和文字",第二轮再指定"把左下角的树、右上角的月亮、屋顶上的兔子分别单独提取出来"。模型能连续两轮准确响应,输出的每一层都保持位置对齐、透明度正确。
这个能力为什么重要?
因为它把"拆图层"变成了一个可以被外部智能体(比如自动化设计流水线里的AI助手)调用的工具,而不是一个死板的固定流程。一个多模态智能体可以按需决定"这次要拆多细"、"这次要单独抠出哪个东西",然后把结果交给别的编辑工具去处理,处理完再合成回去。
论文里配的一张流程图讲得很清楚:一个纯像素接口只能把图片扔给智能体,智能体拿到手还得自己想办法猜图里有什么结构;而图层原生的接口直接把一组持久化的、可以单独操作的对象状态摆在智能体面前,它可以直接调用生成、拆解、编辑、合成这几个工具,像搭积木一样组织整个设计流程。
这就好比你去五金店买一套现成的标准化螺丝钉和螺母(图层原生接口),和你去矿场挖一块原始矿石回来自己冶炼、切割、打磨(纯像素接口)。后者理论上也能造出同样的东西,但每一步都要重新发明轮子。如果没有这套标准化的图层接口,每个想做AI辅助设计的团队都得自己再造一遍"怎么从一张图里认出物体边界"这轮子。
训练数据从哪来:不能用AI生成的图自己训练自己
这一部分其实是整篇论文里我觉得最实在的一段。
研究团队面临一个逻辑上的死循环:如果想让I2L学会"完整图层"(包括被遮挡的隐藏内容),那训练数据本身就得包含这些隐藏内容的真实样子。但如果用AI生成的图层来构造训练数据,那些被遮挡的内容也是AI编造出来的,模型学到的东西无非是继承了生成器本身的偏见和局限,越训练越像在拿自己的影子训练自己。
所以团队选择了一条更笨但更扎实的路:直接用设计师亲手做的PSD文件。
PSD*:Photoshop的专属文件格式,保存了一份设计作品里所有独立图层的原始信息,包括被其他图层遮挡的部分。
PSD文件里,被遮挡的图层内容其实一直都完整保存在文件里,只是最终导出成图片时被盖住了看不见。这就相当于拿到了"标准答案",不需要靠模型去猜测被遮挡的部分应该是什么。
具体流程是,先把PSD里的图层渲染出来,用一个视觉语言模型辅助把相关的图层归并成有意义的语义组(比如把"眼睛""鼻子""嘴巴"这几个零散图层合并成"人脸"),再组织成一个树状的层级结构。注意,视觉语言模型只负责"分组建议",所有实际的像素内容都直接来自原始PSD文件,不会被AI二次生成污染。
这棵树建好之后,一份PSD文档就能自动衍生出三种训练样本:树的根节点对应顶层分解任务,树的中间节点对应递归分解任务,选中某些节点加上剩余部分则对应目标提取任务。一份素材,喂养三种能力,这个设计相当聪明,省了不少数据标注的功夫。
让模型跑得快一点:蒸馏与强化学习
一个模型光是效果好还不够,如果推理速度慢到没法用,那价值也大打折扣。
I2L要在一次推理中同时输出好几层完整分辨率的图像,这天然就会让计算序列变得很长,推理成本随之飙升。为了压缩这个成本,团队用了一套两阶段的后训练流程。
第一阶段叫渐进式蒸馏,用一个学生模型去学习一个更慢但更精确的教师模型的行为,目标是把原本需要很多步才能完成的生成过程压缩到八步就能搞定。这个过程借鉴了SDXL-Lightning的渐进对抗蒸馏思路,还额外加入了一个判别器,专门用来区分"这是教师模型真实生成的终点"还是"这是学生模型模仿出来的终点",防止蒸馏后的模型输出变得过度模糊平滑。
团队还试过另一种叫分布匹配蒸馏的技术方案,但发现效果不理想:透明度会莫名其妙变得都很不透明,颜色内容和透明度掩码对不齐,跟着指令的能力和图层之间的一致性也变弱了。这段坦诚的"失败尝试"记录挺难得,说明研究团队确实是踩过坑之后才选定现在这套方案的。
第二阶段是用一种叫DiffusionNFT的强化学习方法做后训练,目的是针对具体任务再打磨输出质量。
DiffusionNFT*:一种基于扩散模型的强化学习后训练方法,核心思路是给模型生成的样本打一个"好坏分数",分数高的样本被进一步强化,分数低的被反向修正。
针对T2RGBA和I2L,团队设计了不同的打分规则。
T2RGBA用了三个打分器:一个专门检查透明度是不是符合预期(该透明的地方透明,该不透明的地方不透明);一个用CLIP式的方法算生成图和文字提示的语义相似度;还有一个直接让一个大语言模型给生成结果打0到5分。这三个分数会先经过一层"透明度是否正确"的把关,如果透明度本身就错了,哪怕另外两项分数再高也没用,相当于一个硬性门槛。
I2L的打分规则更聚焦在图层还原精度上,用逐像素的RGBA绝对误差加上一个感知相似度网络(LPIPS)的组合分数,每一层单独算分再平均,不搞跨层的连乘惯性。
写在后面
读完这篇论文,最触动我的其实不是那些提升百分之几十的指标,而是那个"用PSD文件训练"的决定。
这背后藏着一个挺朴素但容易被忽略的道理:想让AI学会某种"完整性"的认知,你不能靠AI自己生成数据去教AI,因为它没见过真正完整的东西,它只会把自己的偏见传给下一代。这跟教育里"言传不如身教"有点像,你想让模型学会处理被遮挡的隐藏内容,就得先找到真正保存了这些隐藏内容的原始资料,而不是让模型自己瞎猜然后拿猜测结果当教材。
论文里还有个细节值得单独说一下:团队试过用分布匹配蒸馏来提速,结果发现透明度全变得不透明了,这个"失败"被坦率地写进了论文而不是藏起来。做研究的人大概都懂,这种"我们试过A方案但它把颜色和透明度弄乱了,所以换成了B方案"的记录,比一份只报喜不报忧的成功故事更有参考价值。
如果这条路继续走下去,下一步大概会是什么样子?论文结尾提到,团队接下来想把这套能力扩展到"图层插入替换"和"多轮迭代编辑"。那意味着有一天,你也许可以直接跟AI说"把这个人物往左移一点,背景山换成海",而AI真正理解的,不再是一整张照片该怎么重画,而是这句话到底指向了哪一层、该动哪块积木。
Q&A
Q1:UniWorld-Design是什么?
A:UniWorld-Design是一个把图像生成从"画一整张图"改成"生成可编辑图层"的框架,核心是把带透明通道的RGBA图层当作生成、理解和编辑的最小单位,包含T2RGBA(文字生成透明素材)和I2L(图片拆解成图层)两个模型。
Q2:I2L和普通的图像分割工具有什么区别?
A:普通分割只能抠出画面上肉眼可见的部分,被遮挡的地方会留下透明的洞;I2L学的是完整的语义对象,即使某个物体被遮挡了一部分,拆解出来的图层依然是完整的,挪走遮挡物后不会露馅。
Q3:这套技术训练时用的数据从哪里来?
A:团队没有用AI生成的图层做训练数据,而是直接使用设计师制作的PSD文件,因为PSD里被遮挡的图层内容原本就完整保留着,避免了用AI自己编造的内容训练AI导致的偏见传递问题。
好文章,需要你的鼓励
ARCHead是一种专门压缩大语言模型输出层的方法,通过量化低秩核心与激活度量修正,将LM-head存储压缩至BF16的约25%,质量损失极小。
这项研究发现AI投票推理在多答案问题上会系统性失效,提出用因果数学规则直接验证候选答案的CALVER方法,准确率比投票提升约11至19个百分点,且差距随尝试次数持续扩大。
这项来自港科大与腾讯视频的研究提出WorldCycle框架,通过可逆动作循环构造无标注自验证奖励,将视频世界模型的长程漂移误差降低最高44%,复合动作准确率提升约四倍。
哥本哈根大学团队构建了首个同时覆盖三种引用粒度、屏蔽信息泄露、包含全量段落候选库的法律信息检索数据集LegalPincite,用于评估法律判决段落精确检索任务。