微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 南京大学与腾讯优图联手:只用8块显卡,让"潜伏"在潜空间里的AI画图能力"破壳"进入像素世界

南京大学与腾讯优图联手:只用8块显卡,让"潜伏"在潜空间里的AI画图能力"破壳"进入像素世界

2026-05-19 09:16
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-05-19 09:16 • 科技行者

这项由南京大学、腾讯优图实验室等机构联合完成的研究,以预印本形式发布于2026年5月,论文编号为arXiv:2605.12013,感兴趣的读者可通过该编号查阅完整原文。

**一个让AI画图"脱壳重生"的故事**

现在市面上那些令人叹为观止的AI绘画工具——无论是能画出摄影级别人像的模型,还是能理解复杂文字描述生成精准画面的系统——背后几乎都有同一套核心工作方式:它们并不直接在像素层面"作画",而是先把图像压缩成一种抽象的"草稿密码",在这个压缩版本上完成所有创意工作,最后再由一个叫做VAE(变分自编码器)的翻译器把密码还原成真正的图像。

这套流程有个形象的比喻:相当于一个画家从不直接在画布上落笔,而是先在脑海里构思出一张草稿,再让助手把草稿翻译成最终画作。这种"潜伏空间"(Latent Space)的工作方式确实大幅节省了算力,让AI可以在一个小得多的"画板"上作画。然而,问题也随之而来——草稿翻译成画作的过程中,那些细腻的头发丝、衣物的纹理、文字的锋利边缘,往往在翻译中悄悄丢失了。更麻烦的是,这位"翻译助手"(VAE解码器)本身非常占内存,导致生成超高分辨率图像时往往力不从心,4K画质几乎成了这类模型的禁区。

研究团队面对的核心问题是:有没有办法让AI直接在像素层面作画,同时又不需要从零开始花费天文数字的算力去训练?答案就是他们提出的L2P(Latent-to-Pixel,从潜空间到像素)迁移范式。这套方案的精妙之处在于,它不是推倒重建,而是让现有的顶尖AI模型"换个作画方式"——保留它多年积累的知识和审美,只改变它最终落笔的地方。更令人惊叹的是,完成这次"换身"只需要8块普通显卡,而且连真实的训练图片都不用收集。

**一、那个"翻译助手"到底有多麻烦**

要真正理解L2P解决了什么问题,我们得先多认识一下那位"翻译助手"——VAE。

现代主流AI绘画模型(统称LDM,即潜空间扩散模型)的工作链条是这样的:输入一张真实图像,VAE先把它"压缩"成一个小得多的数学张量,扩散模型在这个小张量上学会如何从噪音中还原出有意义的内容,生成完成后,VAE再把小张量"解压"回原始像素图像。

压缩和解压这两步,就像把一首高清音乐压缩成MP3格式再还原——多少会损失一些高频细节。对于照片里的皮肤、毛发、布料,人眼往往能察觉到一种说不清道不明的"塑料感"或"模糊感",这正是VAE压缩解压过程中信息丢失的痕迹。

更棘手的是内存问题。VAE在解码高分辨率图像时,其内存占用以像素数量的平方速度增长——分辨率翻倍,内存需求翻四倍。这意味着,对于标准的潜空间扩散模型来说,生成一张原生4K图像几乎是不可能完成的任务,内存会直接爆掉。

正因如此,研究团队开始重新审视像素扩散模型的潜力。所谓像素扩散模型,就是那种不经过VAE压缩、直接在原始像素上工作的AI绘画方式。它的优势非常直接:没有压缩损失,没有VAE内存瓶颈,画面细节可以做到真正的像素级精准。然而,它的劣势同样明显:从零训练一个能够理解复杂文字、生成高质量图像的像素扩散模型,需要数百块高端显卡和数十亿张精心筛选的图文对——成本之高,让绝大多数研究团队望而却步。现有的像素扩散模型在语义理解和画面质量上,也与那些经过大规模训练的潜空间模型有着肉眼可见的差距。

**二、"换皮不换骨":L2P的核心思路**

研究团队的突破口在于一个朴素的观察:那些顶尖的潜空间扩散模型,经过海量数据的训练,它们的中间层已经积累了极为丰富的世界知识——什么是一只猫的神态,什么是金属质感的光泽,如何理解"一个穿红色连衣裙的女孩站在雨中"这样的描述。这些知识不在VAE里,而是深深嵌入在模型的Transformer层(一种特殊的神经网络结构,可以理解为模型的"大脑皮层")中。

既然知识在那里,为什么不直接用它,只改变"输入和输出的接口"?

L2P的整体架构就建立在这个想法上。研究团队选择了Z-Image(一个由多家机构共同开发的高性能潜空间扩散模型)作为"知识供体",然后对它进行三处精确改动,其余部分完全保留并冻结。

第一处改动发生在输入端。原来的模型接收的是经过VAE压缩的小张量,现在改为直接接收原始像素图像。为了让序列长度和计算量与原来基本一致,研究团队采用了大块分割策略——把图像切分成16×16像素的小方块,每个方块作为一个基本处理单元。这相当于原来的VAE把图像缩小了若干倍,现在改用更大的分块来等效地减少需要处理的单元数量。

第二处改动发生在输出端。原来的模型最后一层是把内部的抽象表示映射到VAE的小张量,现在改为一个轻量级的U-Net网络(命名为"细节头",Detailer Head)。这个网络的结构像一个对称的沙漏:先把图像特征逐步压缩到更小的尺度,再逐步扩展回原始分辨率,在这个过程中重建出高频的像素细节。这个设计灵感来自另一项相关工作DiP,核心目的是让模型能够直接输出清晰的像素图像,而不是输出需要VAE翻译的中间码。

第三处改动是参数的冻结与解冻策略。模型中间那些积累了大量知识的Transformer层全部被冻结,禁止更新。只有最靠近输入和输出的浅层——具体是最前面和最后面的n个块(实验中设为5个)、输入投影层,以及新加的细节头——被允许更新参数。这就像雇了一位有丰富经验的老工匠,只给他换了一套新的工具和一副新的手套,他多年积累的手感和技巧完全保留,只需要适应一下新的操作方式。

**三、用"AI自己的作品"来训练AI**

模型架构定了,下一个问题是:用什么数据来训练这个改造后的模型?

传统的做法是花费大量人力和资金收集、清洗数以亿计的真实图文对。但研究团队想到了一个更聪明的路子:直接用知识供体Z-Image生成训练图片。

这个策略看起来有点循环,但背后有严密的逻辑。L2P要学会的事情,是"在像素层面复现Z-Image的生成结果"。如果训练数据就是Z-Image自己生成的图像,那么L2P所要拟合的数据分布是已知的、光滑的、没有杂乱噪声的——就像让学生练习的题目直接来自老师出的标准答案,而不是来自网络上质量参差不齐的资料。这种"光滑的数据流形"使得模型收敛速度大幅加快,同时也保证了L2P与知识供体在语义理解上的高度一致。

为了让这批合成训练图片足够多样,研究团队设计了一套四阶段的数据构建流程。

整个流程从一个层级化的类别体系出发。研究团队参考了多项主流工作,定义了自然、设计、文字、人物四大主类,进一步细分为17个子类(比如自然类下面有物体、风景、食物、植物、室内场景、城市景观、动物等),然后借助大型语言模型(LLM,可以理解为一种能够生成文字的高级AI助手),将这17个子类扩展成超过1000个细粒度类别。

有了类别体系,下一步是为每个类别生成高质量的文字描述(提示词)。研究团队为LLM设计了精细的生成规则,要求它用完整的英文句子而非简单的标签罗列来描述场景,要求描述要有层次感(包含简单版本和详细版本),要求视角、光线、风格要多样化,不能每条描述都以"A photo of..."开头。最终生成的提示词集中在200到350个字符之间,内容丰富,细节充足。

生成的提示词还要经过一道自动质量过滤。研究团队设计了另一套规则,用LLM来审查提示词是否格式正确、是否包含不安全内容、是否侵犯版权,通过审查的提示词才被保留下来。这道工序保证了最终送入Z-Image生成图片的文字描述都是高质量的。

最后,将过滤后的提示词输入Z-Image,生成对应的合成图像,这批图像就成为L2P的训练语料。整个过程中,研究团队只准备了1万条多样提示词,生成了2万张合成图像——这个数量级与动辄数以亿计的真实数据集相比,几乎可以忽略不计。

**四、训练目标:保持与"老师"的一致性**

除了数据策略,训练目标的设计也是L2P能够成功的关键。

研究团队选择了与知识供体Z-Image完全相同的扩散训练目标。简单来说,扩散模型的训练是一个反复"去噪"的过程——往图像里加入噪音,然后训练模型把噪音预测出来或者预测去掉噪音后应该得到什么。L2P沿用了Z-Image的流匹配(Flow Matching)目标,这意味着两个模型在优化方向上是一致的。

这种一致性的好处是深层次的。那些被冻结的中间Transformer层,它们在原来的训练过程中学会了如何在特定的目标函数下工作。如果L2P改变了目标函数,冻结的层就会"水土不服",原有的知识无法正常发挥。沿用相同的目标函数,就像让老工匠用他熟悉的衡量标准来评价自己的工作,他能立刻进入状态,不需要重新适应。

用数学符号来表达这个目标(不懂也没关系,只需要知道它的含义):模型要学会预测一个向量,这个向量综合表达了"应该往哪个方向消除噪音、恢复图像",而这个预测目标和Z-Image所学的东西本质上是同一件事,只是现在换在了像素层面上进行。

**五、解锁4K:比例放大时的两个工程技巧**

完成了1024×1024分辨率的基础迁移之后,研究团队进一步尝试将L2P推向原生4K(约3840×2160像素)生成。由于没有了VAE内存瓶颈,L2P的像素架构在原理上完全支持任意分辨率,但工程上还需要解决两个具体问题。

第一个问题是计算量。如果在4K图像上仍然使用16×16的分块,需要处理的单元数量会急剧增加,Transformer层的计算量会以平方速度膨胀,让模型变得极慢。解决方案很直接:把分块大小扩大到64×64。这样处理的单元数量降回到与1024分辨率下16×16分块相当的水平,模型结构无需改变。

第二个问题更微妙。在4K像素图像中,相邻的像素点之间有着极为密集的局部关联——一片草地上的每一根草,都和它旁边的草高度相似,颜色、朝向几乎一致。在训练过程中,如果加入的噪音不够强,模型在去噪时会发现,只需要参考周围几个像素就能完成预测,根本不需要理解整张图的全局结构。这种"走捷径"的行为会导致模型退化成一个局部补全器,而不是真正的全局生成器,最终生成的图像会出现大块重复的纹理或结构失真。

研究团队的解决方案是增大噪音偏移参数,让训练时的噪音更强烈,彻底覆盖掉局部关联信息,强迫模型在高噪音级别下去理解和重建全局结构。通过消融实验(第16页的图12),研究团队找到了最佳的噪音偏移值——当参数从1增大到4时,图像质量衡量指标FID(越低越好)显著下降,说明质量在持续提升;参数超过5之后,噪音过强反而开始损害质量,出现"过腐蚀"现象。

在效率上,L2P-4K相比直接让Z-Image(原始潜空间模型)尝试生成4K图像,单步推理时间缩短了97.67%(从51秒降到1.19秒),显存占用减少了38.81%(从43.78GB降到26.79GB)。这个对比之所以如此悬殊,是因为原始潜空间模型根本没有被设计用来处理4K输入,强行运行时VAE解码器的内存消耗是难以承受的;而L2P的像素架构在这方面完全没有这个包袱。

**六、实验结果:效果如何?**

研究团队在多个标准测试集上对L2P进行了全面评估。

在1024×1024分辨率的标准文图对齐测试中,研究团队使用了DPG-Bench和GenEval两个业界广泛使用的评测框架,前者测量模型对复杂描述的理解能力,后者测量对具体对象、属性、关系的准确生成能力。

L2P在DPG-Bench上获得了86.00分的综合得分,而它的知识供体Z-Image-turbo得分为84.86——换句话说,迁移到像素空间之后,L2P不仅没有退步,反而在这个指标上稍微超越了原版。在GenEval上,L2P得分为0.76,相比Z-Image-turbo的0.82保留了约93%的性能。

与其他像素扩散模型相比,L2P在DPG-Bench上建立了新的最优记录,远超PixelGen(80.01)、Deco(81.25)、PixNerd(82.65)和PixelDiT(83.50)。GenEval上,Deco(0.86)和PixelGen(0.79)的得分看起来接近或略高于L2P(0.76),但研究团队对此有一个重要的补充观察:测量不同随机种子下同一提示词生成图像之间差异度的LPIPS指标(越高说明多样性越好)显示,L2P得分0.61,Deco只有0.55,PixelGen更是只有0.33。Deco和PixelGen在不同随机种子下会生成几乎相同的图像,说明它们实际上牺牲了生成多样性来获得高分,而L2P在保持多样性的同时实现了高精度。

定性比较(即直接看图)方面,研究团队展示了几组对比案例,涵盖复杂文字渲染(生成包含"L2P"字样的发光树)、多语言描述(用中文、韩文描述的场景)、物体属性精准绑定等挑战性任务。其他像素模型在这些案例中频繁出现文字变形、属性混淆、结构失真等问题,而L2P的输出质量与Z-Image原版基本持平。

尤其值得关注的是韩文案例:L2P的迁移训练只使用了2万张英文和中文描述生成的图像,韩文字符从未在训练集中出现过,但L2P能够流畅地渲染出清晰正确的韩文"??"(爱)——这直接证明L2P不是死记硬背了训练集,而是真正继承了Z-Image积累的深层知识,这种知识具有跨语言的泛化能力。

在4K图像质量评测中(使用UltraHR-eval4k数据集),L2P在FID(33.46,越低越好)、FID-patch(21.77,越低越好)和Inception Score(12.28,越高越好)上均达到了参比方法中的最优水平,在CLIP文图一致性得分(31.88)上同样领先,只在细粒度CLIP(FG-CLIP,28.22)上略低于SANA(29.31)。

**七、消融实验:每个设计选择是否真的有效?**

研究团队还进行了一系列消融实验,逐一验证L2P各设计选择的有效性。

关于训练数据来源,研究团队对比了三种方案:用Z-Image生成的合成图像(源数据)、从UltraHR-100K数据集中随机抽取的真实图像(真实数据),以及用另一个模型GLM-Image生成的跨模型合成图像。结果显示,源数据方案收敛最快、最终质量最高;真实数据方案不仅收敛慢,最终质量也明显更低——这从反面证明了合成数据的分布高度贴合模型所需;跨模型数据的效果介于两者之间,因为不同模型的生成风格和语义分布有差异,存在先天的对齐偏差。

关于可训练层数的选择,研究团队对比了只训练5层(浅层微调,L2P的默认方案)、训练10层(中层微调)和训练全部层(全量微调)三种方案。结论非常清晰:浅层微调方案随着训练步数增加表现持续稳步提升;全量微调方案则出现了明显的性能停滞甚至下降——释放太多层的参数,会破坏冻结层中积累的知识,得不偿失。中层微调介于两者之间,但优势不如浅层方案明显。

关于训练数据规模,研究团队对比了1万、2万、10万张合成图像的效果。从1万增加到2万时,两个评测指标都有明显提升;但从2万增加到10万时,提升幅度已经非常有限。这说明L2P对数据量的需求极为精简,2万张图像基本上就能覆盖足够多样的数据分布,额外的数据带来的边际收益快速递减。

**八、零样本分辨率外推:意外之喜**

研究团队还展示了一个并未在训练目标中专门设计、但在实验中自然涌现的能力:零样本分辨率外推。

L2P的基础版本在1024×1024分辨率下训练,4K版本在4K分辨率下训练。研究团队尝试直接让4K版本生成8K分辨率的图像,在没有任何针对8K的专门训练的情况下,L2P生成的8K图像展现出了整体结构连贯、微观细节清晰的效果(见原论文图15)。

这种泛化能力的根源在于L2P的像素空间工作方式:像素扩散模型在不同分辨率之间的泛化比潜空间模型更自然,因为像素级别的统计规律在不同分辨率下有着更好的一致性;而潜空间模型的VAE是专门针对特定压缩比设计的,换了分辨率往往需要重新训练或专门的适配。

**研究的局限与未来方向**

研究团队在论文末尾坦诚地指出了两个局限性。

第一个局限是上限约束:L2P的语义理解能力和画面质量的天花板,由知识供体Z-Image决定。L2P没有办法凭空超越源模型的能力边界,它只能尽可能地迁移和保留,不能创造出源模型没有的知识。如果Z-Image对某个领域(比如特定文化背景的视觉元素)理解不足,L2P也会在这方面表现欠佳。引入真实数据理论上可以补充这些盲区,但会增加数据收集成本,偏离L2P的低成本初衷。

第二个局限是约束性更强的像素级损失函数未被探索。在像素空间直接工作的一个天然优势,是可以在训练时引入针对像素的专项约束,比如感知损失(让生成图像在人眼感知上更自然)或基于物理的约束(让光影符合物理规律)。L2P目前为了保持通用性,没有引入这类专项损失,这意味着在一些需要特别精准控制的下游任务上,还有进一步优化的空间。

---

说到底,L2P这项研究做了一件优雅的事:它没有试图从零建造一座新大楼,而是找到了一种方法,把已有大楼的灵魂装进一个新的躯壳,同时还让这个新躯壳拥有了原来做不到的能力。对于整个AI视觉生成领域来说,这意味着高质量的像素扩散模型不再是顶尖机构的专属,普通的研究团队借助8块显卡和一批合成数据,也有机会站在巨人的肩膀上完成这个转变。随着这一思路的推广,原来被认为计算成本高不可攀的像素级生成,或许会逐渐变成一件触手可及的事。

---

Q&A

Q1:L2P框架和普通的潜空间扩散模型(比如Stable Diffusion)相比,生成图像质量的差距有多大?

A:根据实验结果,L2P在DPG-Bench综合评测上得分86.00,略超其知识供体Z-Image-turbo的84.86,说明经过L2P迁移后的像素模型在语义对齐方面不仅没有明显退步,某些指标上反而稍有提升。在GenEval评测上,L2P保留了源模型约93%的性能。整体来看,差距非常小,属于同一量级。

Q2:L2P生成4K图像时需要多少显存,普通消费级显卡能用吗?

A:根据论文数据,L2P-4K的峰值显存占用约为26.79GB,这仍然超出了大多数消费级显卡(通常16GB以下)的上限。不过相比用原始潜空间模型强行生成4K所需的43.78GB,已经减少了近40%。目前这个级别仍需要专业级显卡,但研究方向本身指向了更高效的高分辨率生成路线。

Q3:L2P迁移训练只用了2万张合成图像,这个数量是否足以保证模型的泛化能力?

A:消融实验证明,从2万增加到10万张图像时,模型性能的提升已经非常有限,说明2万张确实覆盖了足够多样的数据分布。更有力的证据是跨语言泛化:L2P训练集中没有任何韩文图像,但它能够准确渲染韩文文字,这说明模型的能力来自继承的深层知识,而非对训练集的简单记忆,具备较强的泛化性。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-