
你有没有想过,一个AI画家和一个AI摄影师,其实用的是同一套底层视觉语言,却因为学习顺序不同,画出来的画天差地别?
这听起来有点玄乎,但这正是这篇论文要讲的故事的核心。故事得从图像生成模型的一个"潜规则"说起。
现在几乎所有厉害的AI绘图模型,比如Stable Diffusion这类,都不是直接在像素上画画的。它们会先把图片压缩成一种更紧凑的"密码本",术语叫潜在空间
潜在空间:把高维的原始图像压缩成一个低维、抽象的数字表示,AI在这个"压缩包"里做运算,比在原始像素上操作要轻松得多。
负责压缩和解压的模块叫VAE(变分自编码器)
VAE:一种先把图片"压缩成密码"再"解压还原"的神经网络,压缩部分叫编码器,解压部分叫解码器,中间会引入一点随机性来让潜在空间更平滑。
整个流程分两步走:先训练VAE把图片压缩解压得漂漂亮亮,再冻结这个VAE,在它压缩出来的"密码"上训练一个生成模型去学着画新图。这套流程用了快十年,大家都觉得天经地义。
但问题来了。
VAE压缩图片时,唯一的目标是"重建得像",它从没想过自己压缩出来的密码本好不好被后面的生成模型学习。这就好比一个图书管理员,编目录的时候只在乎"读者能不能准确找到原书",压根没考虑"另一个要靠这套目录写读书报告的人,会不会觉得这套分类逻辑特别拧巴、难以归纳规律"。近几年不少研究都发现,这种只顾重建、不顾生成的潜在空间,其实并不是生成模型最好用的画布。
那能不能让生成模型也参与到VAE的训练里,两者一起学,互相迁就?这个想法很自然,但一试就炸。
一炸就崩:直接联合训练为什么会失败
之前有个叫REPA-E的工作尝试过这条路,让生成模型的梯度直接回传去调整VAE。结果发现,VAE的潜在空间会"塌陷",术语叫潜在坍缩
潜在坍缩:VAE编码出的潜在向量失去了多样性,不管输入什么图片,编码结果都挤成了几乎一模一样的常数,整个潜在空间失去了信息量。
一旦坍缩发生,整个模型就废了,因为不同的图片被编码成了差不多的东西,生成模型自然学不出任何有意义的分布。REPA-E的解决方案是绕开这个坑:干脆切断生成模型对VAE的梯度回传,转而用一个叫DINOv2的预训练视觉模型的特征,间接地"矫正"VAE的潜在空间。这确实避免了崩溃,但代价是生成目标没法直接塑造潜在空间了,只能靠一个外部代理来打辅助。
这篇论文的作者们没有绕开这个问题,而是一头扎进去,想搞清楚:坍缩到底是怎么发生的?
他们把目光投向了VAE训练里一个常年被当作"打酱油"配角的东西:KL散度损失里的熵项。
KL散度:衡量两个概率分布差异的一个数学工具,VAE训练时用它来约束编码出的潜在分布不要偏离一个标准的高斯分布太远。
在标准的VAE训练配方里(这套配方最早由LDM那篇论文定下来),KL散度的权重被设得极小,通常是十的负六次方那么小,几乎可以忽略不计。大家一直把它当成一个无关紧要的正则化小尾巴。
但论文作者把KL散度拆开来看,发现它其实是两股力量在拔河:一股叫"先验拟合项",会把潜在样本往高斯先验的高概率区域拽;另一股叫"熵项",负责维持潜在分布的不确定性,防止它坍缩成一个个孤立的点。
在原来的两阶段训练里,因为KL权重本来就小得可以忽略,这两股力量谁也没使多大劲,相安无事。可一旦你把生成模型的损失也加进来联合训练,麻烦就来了:生成模型的损失本质上也是在拟合先验,相当于给"先验拟合"这股力量疯狂加码,而"熵"这股反制力量却还停留在原来那个几乎为零的权重上。天平彻底失衡,潜在空间被先验拟合的力量硬生生压扁,方差趋近于零,所有图片的编码挤到了同一个点附近,这就是坍缩的真正机制。
这就好比拔河比赛,一边突然加入了三个壮汉,另一边却还是原来那两个人拿着根细绳子应付,绳子瞬间就被拽到了对面,如果不给弱势的一方也加人手,比赛结果从一开始就没有悬念。
论文作者由此得到一个清晰的诊断结论:熵项不是可有可无的正则化装饰,它是对抗先验拟合、防止坍缩的必要反作用力。他们把公式重新写了一遍,明确把熵项作为一个独立的、需要主动调节权重的分量加进最终的训练目标里,而不是继续沿用那个历史遗留的十的负六次方。这个改动听起来简单,效果却立竿见影:直接端到端训练不再崩溃了。
生成和重建,谁先谁后是个大问题
解决了崩溃问题,故事还没完。论文作者接着发现了第二个更微妙的矛盾:重建和生成天生就在互相拆台,术语上叫生成重建冲突
生成重建冲突:重建任务想保留图片的每一个细节,导致潜在空间的编码彼此分得很开、很分散;而生成任务想要一个更平滑、更容易采样建模的潜在分布,这两个目标本质上互相拉扯。
论文做了个很直白的实验:固定其他条件,只调节生成损失的权重。权重从0调到1.0时,代表生成质量的gFID指标(数值越低越好)从120.60一路降到8.06,说明生成变强了;可与此同时,代表重建质量的rFID却从0.53恶化到4.20,重建变差了。两条曲线一个往下一个往上,像跷跷板一样谁也不让谁。
研究者试了三条常规的补救思路,结果都不太理想。
第一条是加大潜在维度,给VAE更大的信息容量,指望这样能同时容纳更丰富的重建细节和更好建模的分布。结果维度从16加到128,也只能撑住大约0.1的先验权重,超过这个数重建照样崩。第二条是把VAE本身做大做深,指望更强的解码器能从"更适合生成"的潜在空间里抠出更多细节。结果发现VAE变大不但没解决冲突,甚至有时候重建反而更差。第三条是把生成模型做大,让它更有能力拟合复杂分布。结果生成确实变好了,但对潜在空间的"塑形压力"也跟着更猛,重建被进一步拖累。
三条路都走不通,说明这不是一个简单靠"加码资源"就能摆平的问题。论文接着尝试了各种损失权重的动态调度方案:固定权重、余弦衰减、还有一种叫PI自适应控制的反馈式调节方法(灵感来自ControlVAE)。可惜没有一种方案能同时让生成和重建都满意,PI自适应控制那组实验甚至直接训练崩溃了。
问题出在哪儿?作者回过头去观察两个任务各自的学习速度,这才注意到一个此前被忽略的现象:重建和生成的学习节奏完全不对称
论文里画了一张对比图特别直观。重建任务这边,模型从一片模糊的色块出发,训练不到5万步就已经能画出轮廓清晰的鲨鱼,到4万7千步左右图像质量基本稳定不动了。而生成这边,同样是从随机噪声出发,模型要训练到二三十万步才能画出一条勉强像样的鲨鱼,整个收敛曲线拉得老长,训练了30万步FID才降到接近饱和的水平。
这个不对称性其实很好理解。重建是个有明确目标答案的映射问题,输入一张图的潜在编码,解码器直接对着原图算误差,每一步都有清晰的纠错信号,学得又快又准。而生成是个从头摸索整个数据分布形状的问题,模型得先搞明白"合理的潜在空间长什么样",才谈得上从里面采样出新东西,这个过程天然更慢、更难。
如果把这两个任务的进度拿去做类比,重建像是照着参考答案抄作业,几乎是看一眼就能写对;生成则像是通过反复做题去总结出题老师的出题规律,需要看过成千上万道题才能摸到门道。如果强行让两者用同一个学习节奏推进,要么是抄作业的那个已经写完了还在傻等,要么是总结规律的那个被逼着提前交卷,规律还没摸透。
这个发现直接催生了这篇论文真正的主角,一个简单到有点朴素的策略,叫GenFirst
GenFirst:一种"先生成后重建"的两阶段端到端训练策略,第一阶段用较大的生成损失权重,让生成目标优先塑造潜在空间的整体形状;第二阶段把生成损失权重调小,让重建任务有更多余地去恢复细节。
GenFirst的逻辑其实很朴素:既然生成任务学得慢、需要更长时间去摸清整个潜在分布的结构,那就先让它在训练早期占主导地位,用较弱的重建压力和明确的熵项保护,把潜在空间的大致轮廓塑造成一个生成模型容易学习的样子。等这个轮廓稳定下来之后,再逐渐加强重建的权重,让解码器回过头去精细打磨每一张图的细节,而不至于把前面辛苦塑造出来的、对生成友好的空间结构给推翻重来。
这就像装修房子先定框架再做精装。如果一开始就一边砌墙一边贴瓷砖抠细节,很可能砌到一半发现房间格局不对,之前贴好的瓷砖全得敲掉重来;但如果先把整个空间结构定下来,等承重墙、水电走向都确定了,再回头精装每个房间的细节,效率会高得多,也不会出现返工浪费。
具体到操作层面,论文里把熵项的权重和生成损失的权重绑在一起变化,两者用同一个系数,这样熵的保护力度会随着生成压力的大小自动匹配,不会出现前面说的那种失衡。第一阶段用较大的权重(比如自回归模型设为1.0),跑相对较长的训练轮数;第二阶段把权重调小(比如降到0.25),用较短的时间做重建精修。
两种生成模型,一样的方法
论文没有只在一种生成模型上验证这个思路,而是选了两种性质完全不同的生成先验来做交叉验证。
第一种是连续自回归模型,来自一篇叫FARMER的工作,这类模型的特点是有精确的似然函数
似然:衡量一个概率模型对观测数据的解释程度,精确似然意味着可以直接算出一个具体的概率值,而不需要绕弯子估计。
有了精确似然,前面那套关于先验拟合和熵的数学分析就可以直接、干净地对上号,这也是为什么论文选它作为主要分析工具。论文把这个端到端训练的自回归实例叫做EAR,用的是一种叫高斯混合模型的输出头,每个潜在token的分布用多个高斯分量叠加来表示,这样可以处理连续值而不是像文字生成那样用离散的词表。
第二种是SiT,一种基于流匹配的扩散类模型,这类模型没有显式的似然函数,训练目标是学习一个"速度场",让噪声逐步演变成真实数据。作者把这个端到端实例叫EiT。因为SiT没有精确似然,直接套用熵项分析没那么直白,作者额外保留了一个很小权重的KL约束(还是那个十的负六次方),专门用来防止潜在数值的尺度跑飞,避免模型偷懒走捷径。
这个"捷径"问题论文里也仔细拆解过,挺有意思。如果潜在编码全都塌缩成了一个几乎恒定的值,扩散模型做去噪训练时,噪声插值后的结果几乎完全由噪声本身决定,模型只需要学一个简单的线性变换就能糊弄过去这个去噪任务,根本不用真正理解图像分布。这就好比一场默写考试,如果所有学生的答案纸提前都被抹成了同一种底色,阅卷老师光看底色区分不出谁写得好,考试也就失去了检验能力的意义。防止潜在空间坍缩,本质上就是在保证这场"考试"始终有效。
数字说话:结果到底好在哪儿
理论讲得再漂亮,最终还是要看跑分。
在ImageNet 256×256这个图像生成的经典考场上,EAR只用了3.12亿参数,配合CFG(一种提升生成质量的引导技巧)后gFID做到了2.10,比参数量大得多的同类连续自回归模型都要好,比如GIVT是2.59,FARMER是3.60,JetFormer是6.64。
CFG(classifier-free guidance,无分类器引导):一种在采样阶段增强生成结果与条件(比如类别标签或文本)匹配程度的技巧,通常能明显提升生成图像的质量和相关性。
而EiT这边的成绩更亮眼。只训练了480个epoch,带CFG的gFID就做到了0.988,论文特别强调这是第一个在不借助额外的"Fréchet距离损失"技巧的情况下,把FID做到1以下的扩散模型。继续训练到800个epoch,不加CFG的gFID也降到了1.45,是当时对比的扩散模型里最好的成绩。
更值得说的是训练效率。论文比较了几种方法达到同样FID水平所需要的训练步数:用GenFirst训练出的潜在空间,配合新训练的生成模型,只需10万步就能达到FID 6.91,15万步达到4.97,这个速度分别比原始SiT和加了REPA的SiT快至少70倍和26倍。跟REPA-E比,也只需要大约200万步就能追平后者的最终效果,相当于省下一半的训练开销。
这个提速的意义不难理解:如果一个更好的潜在空间能让生成模型少走弯路,那前期在端到端训练上多花的一点力气,后面能在生成模型的训练成本上省回来好几倍,这笔账怎么算都划算。
在文本生成图像的任务上,1.3B参数规模的EiT拿到了GenEval评测0.90的总分,超过了参数量大得多的FLUX.2-dev、Qwen-Image,也超过了一些统一多模态模型比如MetaQuery和BAGEL。DPG-Bench评测上拿到82.60分,换用更强的文本编码器Qwen3-1.7B后进一步提升到84.65。
论文还做了不少细致的消融实验来验证每个设计选择的必要性。比如对比了固定生成损失权重、余弦衰减和PI自适应控制这三种常见的调度方式,全都不如GenFirst效果好,PI自适应控制甚至直接训崩了。这说明单纯调整权重大小解决不了这个问题,先后顺序才是关键。
论文里还有个有意思的对照实验:把端到端训练学出来的VAE冻结起来,重新从头训练一个全新的生成先验。结果发现新训练出来的先验,效果比在原始重建优化的VAE上训练的先验好得多,EAR的gFID从36.33降到5.67,SiT的gFID从7.90降到3.57。这说明端到端训练确实塑造出了一个更适合被生成模型学习的潜在空间,这种"友好性"是可以迁移、可以复用的属性,不是训练过程里的偶然现象。
不止于图像:一个可以扩展的框架
论文最后一部分探索了这套端到端框架能不能扩展到更多场景,读下来能感受到作者是真心想把这个思路做通做透,而不是只满足于刷一个漂亮的图像生成分数。
第一个扩展方向是让潜在空间同时支持生成和表征学习。作者把FLUX VAE的编码器换成了Qwen3-VL的视觉Transformer,试了两种引入语义监督的方式:一种是直接在潜在特征上加对比学习式的SigLIP损失,另一种是把编码器的中间特征喂给一个视觉语言模型去预测图片描述文字的负对数似然。结果显示,加入基于图注生成的监督后,ImageNet线性探测准确率从77.71提升到了81.69,甚至超过了预训练的Qwen3-VL视觉塔本身(79.64),同时生成和重建质量基本没有明显损失。这说明生成友好的潜在空间和语义丰富的表征空间并不是天然对立的,两者可以在同一个潜在空间里共存。
第二个扩展方向更大胆一些,把文本也纳入了同一套端到端框架里,做统一的文本图像生成。作者训练了一个文本VAE,把连续文本潜在表示和图像潜在表示一起喂给一个块因果的MMDiT(一种既支持双向注意力又支持因果注意力的Transformer架构),同时训练"文生图"和"图生文"两个方向的生成任务。结果显示,把冻结的文本VAE换成端到端训练版本后,GenEval从79.88提升到81.87,图生文任务的CIDEr指标(衡量生成描述质量的常用指标)从20.03跳到30.19;如果进一步把文本和图像的VAE一起联合训练,GenEval能到86.57,CIDEr到33.28。这个结果说明,"生成塑造潜在空间"这个思路并不局限于图像这一个模态,只要能定义出合适的生成目标和熵约束,文本这类离散但可以连续化的模态一样适用。
写在后面
读完这篇论文,最让我意外的一点,是它没有去发明一个多么复杂的新模型架构,而是花了大量篇幅去做一件很朴素的事:把一个长期被当作工程细节忽略掉的小权重项,重新掰开揉碎讲清楚它的物理意义。KL散度里那个熵项存在了这么多年,几乎所有从业者都默认它就是个数值稳定器,很少有人认真追问过它在联合训练场景下到底扮演什么角色。这提醒我一件事:很多"行业常识"其实只是在特定训练配方下凑巧成立的经验规则,一旦训练设置发生变化,原来被忽略的细枝末节可能突然变成决定成败的关键变量。
另一个让我印象深刻的地方,是论文用一张训练曲线图就把"生成重建冲突"这个抽象概念讲清楚了。重建曲线几千步就趋于平稳,生成曲线要几十万步才勉强像样,这种直观的速度差异比任何数学推导都更容易让人理解为什么"先后顺序"比"权重大小"更重要。这也让我想到,很多多任务学习里的失败案例,或许都值得回过头去看看各个任务各自的收敛速度曲线,说不定问题根源就藏在这种被忽视的时间维度里。
论文在结尾也很坦诚地承认了局限:GenFirst缓解了冲突,但没有彻底消除它,端到端训练出来的VAE在PSNR这类重建指标上还是会有一定牺牲。另外,连续自回归模型在配合CFG引导时表现出的规律和不用CFG时不太一致,作者也直言这背后的引导机制还需要专门研究。这种不回避问题的态度,反而让整篇论文的可信度更高。
如果潜在空间的"性格"真的是由训练顺序塑造出来的,那么换一个顺序、换一种节奏,会不会调教出完全不同气质的生成模型?
Q&A
Q1:GenFirst是什么?
A:GenFirst是一种先生成后重建的两阶段端到端训练策略,第一阶段用较大的生成损失权重塑造潜在空间,第二阶段减小该权重让重建任务恢复图像细节,从而缓解生成和重建之间的冲突。
Q2:直接联合训练VAE和生成模型为什么会导致潜在坍缩?
A:因为生成损失会给KL散度里的先验拟合力量加码,而对抗坍缩的熵项权重却还停留在原来极小的数值,两股力量失衡后,潜在编码方差趋近于零,不同图片被压缩成几乎相同的编码,导致整个潜在空间失去信息量。
Q3:GenFirst在图像生成任务上效果如何?
A:在ImageNet 256×256上,EiT不加CFG的gFID达到1.45,带CFG的gFID为0.97,文本生成图像上MMDiT的GenEval评分达到0.90,同时训练收敛速度比同类方法快数十倍。
好文章,需要你的鼓励
论文提出动态民主同意框架,融合伯奈斯公关理论与系统动力学反馈模型,分析政治支持率如何受滚雪球增长、选民饱和、感知延迟和制度信任侵蚀四种机制影响,揭示宣传投放为何会失效甚至反噬。
阿里巴巴团队推出E-Commerce Bench基准,让18个顶尖AI模型经营虚拟网店一年,揭示AI在长周期自主商业决策、供应商谈判防骗、现金流管理及经验学习方面存在巨大能力差异与隐藏短板。
本文解读ReFlowSET框架,它通过系统评测多款图像压缩器选出最适合雷达与光学图像的编解码器,并从零训练轻量生成模型完成雷达图到光学图的翻译,在多个数据集上取得领先的感知与分布质量表现。
阿里团队提出DICS方法,通过评估图片、问题、答案三者的内在一致性给训练数据打分,结合自适应采样策略筛选高质量子集。仅用25%的LLaVA-1.5-665K数据训练即超越全量数据效果,并在600万样本规模验证下用不到四分之一数据逼近官方InternVL3-8B性能。