
这项由南京大学、腾讯优图实验室等机构联合完成的研究,以预印本形式发布于2026年5月,论文编号为arXiv:2605.12013,感兴趣的读者可通过该编号查阅完整原文。
**一个让AI画图"脱壳重生"的故事**
现在市面上那些令人叹为观止的AI绘画工具——无论是能画出摄影级别人像的模型,还是能理解复杂文字描述生成精准画面的系统——背后几乎都有同一套核心工作方式:它们并不直接在像素层面"作画",而是先把图像压缩成一种抽象的"草稿密码",在这个压缩版本上完成所有创意工作,最后再由一个叫做VAE(变分自编码器)的翻译器把密码还原成真正的图像。
这套流程有个形象的比喻:相当于一个画家从不直接在画布上落笔,而是先在脑海里构思出一张草稿,再让助手把草稿翻译成最终画作。这种"潜伏空间"(Latent Space)的工作方式确实大幅节省了算力,让AI可以在一个小得多的"画板"上作画。然而,问题也随之而来——草稿翻译成画作的过程中,那些细腻的头发丝、衣物的纹理、文字的锋利边缘,往往在翻译中悄悄丢失了。更麻烦的是,这位"翻译助手"(VAE解码器)本身非常占内存,导致生成超高分辨率图像时往往力不从心,4K画质几乎成了这类模型的禁区。
研究团队面对的核心问题是:有没有办法让AI直接在像素层面作画,同时又不需要从零开始花费天文数字的算力去训练?答案就是他们提出的L2P(Latent-to-Pixel,从潜空间到像素)迁移范式。这套方案的精妙之处在于,它不是推倒重建,而是让现有的顶尖AI模型"换个作画方式"——保留它多年积累的知识和审美,只改变它最终落笔的地方。更令人惊叹的是,完成这次"换身"只需要8块普通显卡,而且连真实的训练图片都不用收集。
**一、那个"翻译助手"到底有多麻烦**
要真正理解L2P解决了什么问题,我们得先多认识一下那位"翻译助手"——VAE。
现代主流AI绘画模型(统称LDM,即潜空间扩散模型)的工作链条是这样的:输入一张真实图像,VAE先把它"压缩"成一个小得多的数学张量,扩散模型在这个小张量上学会如何从噪音中还原出有意义的内容,生成完成后,VAE再把小张量"解压"回原始像素图像。
压缩和解压这两步,就像把一首高清音乐压缩成MP3格式再还原——多少会损失一些高频细节。对于照片里的皮肤、毛发、布料,人眼往往能察觉到一种说不清道不明的"塑料感"或"模糊感",这正是VAE压缩解压过程中信息丢失的痕迹。
更棘手的是内存问题。VAE在解码高分辨率图像时,其内存占用以像素数量的平方速度增长——分辨率翻倍,内存需求翻四倍。这意味着,对于标准的潜空间扩散模型来说,生成一张原生4K图像几乎是不可能完成的任务,内存会直接爆掉。
正因如此,研究团队开始重新审视像素扩散模型的潜力。所谓像素扩散模型,就是那种不经过VAE压缩、直接在原始像素上工作的AI绘画方式。它的优势非常直接:没有压缩损失,没有VAE内存瓶颈,画面细节可以做到真正的像素级精准。然而,它的劣势同样明显:从零训练一个能够理解复杂文字、生成高质量图像的像素扩散模型,需要数百块高端显卡和数十亿张精心筛选的图文对——成本之高,让绝大多数研究团队望而却步。现有的像素扩散模型在语义理解和画面质量上,也与那些经过大规模训练的潜空间模型有着肉眼可见的差距。
**二、"换皮不换骨":L2P的核心思路**
研究团队的突破口在于一个朴素的观察:那些顶尖的潜空间扩散模型,经过海量数据的训练,它们的中间层已经积累了极为丰富的世界知识——什么是一只猫的神态,什么是金属质感的光泽,如何理解"一个穿红色连衣裙的女孩站在雨中"这样的描述。这些知识不在VAE里,而是深深嵌入在模型的Transformer层(一种特殊的神经网络结构,可以理解为模型的"大脑皮层")中。
既然知识在那里,为什么不直接用它,只改变"输入和输出的接口"?
L2P的整体架构就建立在这个想法上。研究团队选择了Z-Image(一个由多家机构共同开发的高性能潜空间扩散模型)作为"知识供体",然后对它进行三处精确改动,其余部分完全保留并冻结。
第一处改动发生在输入端。原来的模型接收的是经过VAE压缩的小张量,现在改为直接接收原始像素图像。为了让序列长度和计算量与原来基本一致,研究团队采用了大块分割策略——把图像切分成16×16像素的小方块,每个方块作为一个基本处理单元。这相当于原来的VAE把图像缩小了若干倍,现在改用更大的分块来等效地减少需要处理的单元数量。
第二处改动发生在输出端。原来的模型最后一层是把内部的抽象表示映射到VAE的小张量,现在改为一个轻量级的U-Net网络(命名为"细节头",Detailer Head)。这个网络的结构像一个对称的沙漏:先把图像特征逐步压缩到更小的尺度,再逐步扩展回原始分辨率,在这个过程中重建出高频的像素细节。这个设计灵感来自另一项相关工作DiP,核心目的是让模型能够直接输出清晰的像素图像,而不是输出需要VAE翻译的中间码。
第三处改动是参数的冻结与解冻策略。模型中间那些积累了大量知识的Transformer层全部被冻结,禁止更新。只有最靠近输入和输出的浅层——具体是最前面和最后面的n个块(实验中设为5个)、输入投影层,以及新加的细节头——被允许更新参数。这就像雇了一位有丰富经验的老工匠,只给他换了一套新的工具和一副新的手套,他多年积累的手感和技巧完全保留,只需要适应一下新的操作方式。
**三、用"AI自己的作品"来训练AI**
模型架构定了,下一个问题是:用什么数据来训练这个改造后的模型?
传统的做法是花费大量人力和资金收集、清洗数以亿计的真实图文对。但研究团队想到了一个更聪明的路子:直接用知识供体Z-Image生成训练图片。
这个策略看起来有点循环,但背后有严密的逻辑。L2P要学会的事情,是"在像素层面复现Z-Image的生成结果"。如果训练数据就是Z-Image自己生成的图像,那么L2P所要拟合的数据分布是已知的、光滑的、没有杂乱噪声的——就像让学生练习的题目直接来自老师出的标准答案,而不是来自网络上质量参差不齐的资料。这种"光滑的数据流形"使得模型收敛速度大幅加快,同时也保证了L2P与知识供体在语义理解上的高度一致。
为了让这批合成训练图片足够多样,研究团队设计了一套四阶段的数据构建流程。
整个流程从一个层级化的类别体系出发。研究团队参考了多项主流工作,定义了自然、设计、文字、人物四大主类,进一步细分为17个子类(比如自然类下面有物体、风景、食物、植物、室内场景、城市景观、动物等),然后借助大型语言模型(LLM,可以理解为一种能够生成文字的高级AI助手),将这17个子类扩展成超过1000个细粒度类别。
有了类别体系,下一步是为每个类别生成高质量的文字描述(提示词)。研究团队为LLM设计了精细的生成规则,要求它用完整的英文句子而非简单的标签罗列来描述场景,要求描述要有层次感(包含简单版本和详细版本),要求视角、光线、风格要多样化,不能每条描述都以"A photo of..."开头。最终生成的提示词集中在200到350个字符之间,内容丰富,细节充足。
生成的提示词还要经过一道自动质量过滤。研究团队设计了另一套规则,用LLM来审查提示词是否格式正确、是否包含不安全内容、是否侵犯版权,通过审查的提示词才被保留下来。这道工序保证了最终送入Z-Image生成图片的文字描述都是高质量的。
最后,将过滤后的提示词输入Z-Image,生成对应的合成图像,这批图像就成为L2P的训练语料。整个过程中,研究团队只准备了1万条多样提示词,生成了2万张合成图像——这个数量级与动辄数以亿计的真实数据集相比,几乎可以忽略不计。
**四、训练目标:保持与"老师"的一致性**
除了数据策略,训练目标的设计也是L2P能够成功的关键。
研究团队选择了与知识供体Z-Image完全相同的扩散训练目标。简单来说,扩散模型的训练是一个反复"去噪"的过程——往图像里加入噪音,然后训练模型把噪音预测出来或者预测去掉噪音后应该得到什么。L2P沿用了Z-Image的流匹配(Flow Matching)目标,这意味着两个模型在优化方向上是一致的。
这种一致性的好处是深层次的。那些被冻结的中间Transformer层,它们在原来的训练过程中学会了如何在特定的目标函数下工作。如果L2P改变了目标函数,冻结的层就会"水土不服",原有的知识无法正常发挥。沿用相同的目标函数,就像让老工匠用他熟悉的衡量标准来评价自己的工作,他能立刻进入状态,不需要重新适应。
用数学符号来表达这个目标(不懂也没关系,只需要知道它的含义):模型要学会预测一个向量,这个向量综合表达了"应该往哪个方向消除噪音、恢复图像",而这个预测目标和Z-Image所学的东西本质上是同一件事,只是现在换在了像素层面上进行。
**五、解锁4K:比例放大时的两个工程技巧**
完成了1024×1024分辨率的基础迁移之后,研究团队进一步尝试将L2P推向原生4K(约3840×2160像素)生成。由于没有了VAE内存瓶颈,L2P的像素架构在原理上完全支持任意分辨率,但工程上还需要解决两个具体问题。
第一个问题是计算量。如果在4K图像上仍然使用16×16的分块,需要处理的单元数量会急剧增加,Transformer层的计算量会以平方速度膨胀,让模型变得极慢。解决方案很直接:把分块大小扩大到64×64。这样处理的单元数量降回到与1024分辨率下16×16分块相当的水平,模型结构无需改变。
第二个问题更微妙。在4K像素图像中,相邻的像素点之间有着极为密集的局部关联——一片草地上的每一根草,都和它旁边的草高度相似,颜色、朝向几乎一致。在训练过程中,如果加入的噪音不够强,模型在去噪时会发现,只需要参考周围几个像素就能完成预测,根本不需要理解整张图的全局结构。这种"走捷径"的行为会导致模型退化成一个局部补全器,而不是真正的全局生成器,最终生成的图像会出现大块重复的纹理或结构失真。
研究团队的解决方案是增大噪音偏移参数,让训练时的噪音更强烈,彻底覆盖掉局部关联信息,强迫模型在高噪音级别下去理解和重建全局结构。通过消融实验(第16页的图12),研究团队找到了最佳的噪音偏移值——当参数从1增大到4时,图像质量衡量指标FID(越低越好)显著下降,说明质量在持续提升;参数超过5之后,噪音过强反而开始损害质量,出现"过腐蚀"现象。
在效率上,L2P-4K相比直接让Z-Image(原始潜空间模型)尝试生成4K图像,单步推理时间缩短了97.67%(从51秒降到1.19秒),显存占用减少了38.81%(从43.78GB降到26.79GB)。这个对比之所以如此悬殊,是因为原始潜空间模型根本没有被设计用来处理4K输入,强行运行时VAE解码器的内存消耗是难以承受的;而L2P的像素架构在这方面完全没有这个包袱。
**六、实验结果:效果如何?**
研究团队在多个标准测试集上对L2P进行了全面评估。
在1024×1024分辨率的标准文图对齐测试中,研究团队使用了DPG-Bench和GenEval两个业界广泛使用的评测框架,前者测量模型对复杂描述的理解能力,后者测量对具体对象、属性、关系的准确生成能力。
L2P在DPG-Bench上获得了86.00分的综合得分,而它的知识供体Z-Image-turbo得分为84.86——换句话说,迁移到像素空间之后,L2P不仅没有退步,反而在这个指标上稍微超越了原版。在GenEval上,L2P得分为0.76,相比Z-Image-turbo的0.82保留了约93%的性能。
与其他像素扩散模型相比,L2P在DPG-Bench上建立了新的最优记录,远超PixelGen(80.01)、Deco(81.25)、PixNerd(82.65)和PixelDiT(83.50)。GenEval上,Deco(0.86)和PixelGen(0.79)的得分看起来接近或略高于L2P(0.76),但研究团队对此有一个重要的补充观察:测量不同随机种子下同一提示词生成图像之间差异度的LPIPS指标(越高说明多样性越好)显示,L2P得分0.61,Deco只有0.55,PixelGen更是只有0.33。Deco和PixelGen在不同随机种子下会生成几乎相同的图像,说明它们实际上牺牲了生成多样性来获得高分,而L2P在保持多样性的同时实现了高精度。
定性比较(即直接看图)方面,研究团队展示了几组对比案例,涵盖复杂文字渲染(生成包含"L2P"字样的发光树)、多语言描述(用中文、韩文描述的场景)、物体属性精准绑定等挑战性任务。其他像素模型在这些案例中频繁出现文字变形、属性混淆、结构失真等问题,而L2P的输出质量与Z-Image原版基本持平。
尤其值得关注的是韩文案例:L2P的迁移训练只使用了2万张英文和中文描述生成的图像,韩文字符从未在训练集中出现过,但L2P能够流畅地渲染出清晰正确的韩文"??"(爱)——这直接证明L2P不是死记硬背了训练集,而是真正继承了Z-Image积累的深层知识,这种知识具有跨语言的泛化能力。
在4K图像质量评测中(使用UltraHR-eval4k数据集),L2P在FID(33.46,越低越好)、FID-patch(21.77,越低越好)和Inception Score(12.28,越高越好)上均达到了参比方法中的最优水平,在CLIP文图一致性得分(31.88)上同样领先,只在细粒度CLIP(FG-CLIP,28.22)上略低于SANA(29.31)。
**七、消融实验:每个设计选择是否真的有效?**
研究团队还进行了一系列消融实验,逐一验证L2P各设计选择的有效性。
关于训练数据来源,研究团队对比了三种方案:用Z-Image生成的合成图像(源数据)、从UltraHR-100K数据集中随机抽取的真实图像(真实数据),以及用另一个模型GLM-Image生成的跨模型合成图像。结果显示,源数据方案收敛最快、最终质量最高;真实数据方案不仅收敛慢,最终质量也明显更低——这从反面证明了合成数据的分布高度贴合模型所需;跨模型数据的效果介于两者之间,因为不同模型的生成风格和语义分布有差异,存在先天的对齐偏差。
关于可训练层数的选择,研究团队对比了只训练5层(浅层微调,L2P的默认方案)、训练10层(中层微调)和训练全部层(全量微调)三种方案。结论非常清晰:浅层微调方案随着训练步数增加表现持续稳步提升;全量微调方案则出现了明显的性能停滞甚至下降——释放太多层的参数,会破坏冻结层中积累的知识,得不偿失。中层微调介于两者之间,但优势不如浅层方案明显。
关于训练数据规模,研究团队对比了1万、2万、10万张合成图像的效果。从1万增加到2万时,两个评测指标都有明显提升;但从2万增加到10万时,提升幅度已经非常有限。这说明L2P对数据量的需求极为精简,2万张图像基本上就能覆盖足够多样的数据分布,额外的数据带来的边际收益快速递减。
**八、零样本分辨率外推:意外之喜**
研究团队还展示了一个并未在训练目标中专门设计、但在实验中自然涌现的能力:零样本分辨率外推。
L2P的基础版本在1024×1024分辨率下训练,4K版本在4K分辨率下训练。研究团队尝试直接让4K版本生成8K分辨率的图像,在没有任何针对8K的专门训练的情况下,L2P生成的8K图像展现出了整体结构连贯、微观细节清晰的效果(见原论文图15)。
这种泛化能力的根源在于L2P的像素空间工作方式:像素扩散模型在不同分辨率之间的泛化比潜空间模型更自然,因为像素级别的统计规律在不同分辨率下有着更好的一致性;而潜空间模型的VAE是专门针对特定压缩比设计的,换了分辨率往往需要重新训练或专门的适配。
**研究的局限与未来方向**
研究团队在论文末尾坦诚地指出了两个局限性。
第一个局限是上限约束:L2P的语义理解能力和画面质量的天花板,由知识供体Z-Image决定。L2P没有办法凭空超越源模型的能力边界,它只能尽可能地迁移和保留,不能创造出源模型没有的知识。如果Z-Image对某个领域(比如特定文化背景的视觉元素)理解不足,L2P也会在这方面表现欠佳。引入真实数据理论上可以补充这些盲区,但会增加数据收集成本,偏离L2P的低成本初衷。
第二个局限是约束性更强的像素级损失函数未被探索。在像素空间直接工作的一个天然优势,是可以在训练时引入针对像素的专项约束,比如感知损失(让生成图像在人眼感知上更自然)或基于物理的约束(让光影符合物理规律)。L2P目前为了保持通用性,没有引入这类专项损失,这意味着在一些需要特别精准控制的下游任务上,还有进一步优化的空间。
---
说到底,L2P这项研究做了一件优雅的事:它没有试图从零建造一座新大楼,而是找到了一种方法,把已有大楼的灵魂装进一个新的躯壳,同时还让这个新躯壳拥有了原来做不到的能力。对于整个AI视觉生成领域来说,这意味着高质量的像素扩散模型不再是顶尖机构的专属,普通的研究团队借助8块显卡和一批合成数据,也有机会站在巨人的肩膀上完成这个转变。随着这一思路的推广,原来被认为计算成本高不可攀的像素级生成,或许会逐渐变成一件触手可及的事。
---
Q&A
Q1:L2P框架和普通的潜空间扩散模型(比如Stable Diffusion)相比,生成图像质量的差距有多大?
A:根据实验结果,L2P在DPG-Bench综合评测上得分86.00,略超其知识供体Z-Image-turbo的84.86,说明经过L2P迁移后的像素模型在语义对齐方面不仅没有明显退步,某些指标上反而稍有提升。在GenEval评测上,L2P保留了源模型约93%的性能。整体来看,差距非常小,属于同一量级。
Q2:L2P生成4K图像时需要多少显存,普通消费级显卡能用吗?
A:根据论文数据,L2P-4K的峰值显存占用约为26.79GB,这仍然超出了大多数消费级显卡(通常16GB以下)的上限。不过相比用原始潜空间模型强行生成4K所需的43.78GB,已经减少了近40%。目前这个级别仍需要专业级显卡,但研究方向本身指向了更高效的高分辨率生成路线。
Q3:L2P迁移训练只用了2万张合成图像,这个数量是否足以保证模型的泛化能力?
A:消融实验证明,从2万增加到10万张图像时,模型性能的提升已经非常有限,说明2万张确实覆盖了足够多样的数据分布。更有力的证据是跨语言泛化:L2P训练集中没有任何韩文图像,但它能够准确渲染韩文文字,这说明模型的能力来自继承的深层知识,而非对训练集的简单记忆,具备较强的泛化性。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
阿里团队提出DICS方法,通过评估图片、问题、答案三者的内在一致性给训练数据打分,结合自适应采样策略筛选高质量子集。仅用25%的LLaVA-1.5-665K数据训练即超越全量数据效果,并在600万样本规模验证下用不到四分之一数据逼近官方InternVL3-8B性能。