
这项由南京大学计算机软件新技术国家重点实验室联合阿里巴巴集团、上海人工智能实验室共同完成的研究,以预印本形式发布于2026年6月24日,论文编号为arXiv:2606.26016。感兴趣的读者可以通过该编号在arXiv学术平台上查阅完整论文。
一、老将新困:图像生成的隐形天花板
有一类AI图像生成技术叫做"标准化流"(Normalizing Flow,以下简称NF),它的工作原理类似一台精密的翻译机器——把复杂的图像数据翻译成一种简单的数学语言(高斯分布),再把这种数学语言翻译回图像。这台翻译机最大的优势是双向无损:既能精准地把图像"压缩"成数学语言,也能严丝合缝地把数学语言"还原"为图像,并且整个翻译过程可以精确计算概率。
然而,这台翻译机有一个深层的困扰。由于它必须保证翻译的完全可逆,也就是说进去多少信息出来必须也是多少信息,它的所有"精力"就不得不同时用于处理图像中所有层次的细节——从整张图的构图、物体的轮廓形状,一直到每个像素点微小的明暗变化。这就好比一位厨师被要求同时负责一整场宴席的所有工作:从整体菜单设计,到每道菜的烹饪,再到每个盘子的摆盘装饰,哪一件都不能漏。精力分散的结果是,他最擅长的部分——对整顿宴席风格的把控——反而做得不够好。
具体来说,图像中有两种信息:一种是"高层语义信息",比如这张图里有一只猫、猫在睡觉、背景是草地,这些是人眼一眼就能理解的核心内容;另一种是"低频像素细节",比如草地上每根草的纹理、猫毛的具体走向,这些是让图像看起来真实细腻的像素级噪声。NF翻译机因为必须面面俱到,往往把大量"翻译精力"浪费在处理这些像素级噪声上,导致真正重要的高层语义信息反而捕捉得不够准确,生成出来的图像在整体结构和语义合理性上表现不佳。
与此同时,AI领域还有另一项流行技术叫做"掩码图像建模"(Masked Image Modeling,以下简称MIM)。这项技术的核心思路非常直觉:把一张图的某些区域遮住,然后让AI去猜被遮住的部分是什么。就像做填字游戏一样,AI在反复练习中学会了深刻理解图像的整体结构和语义——因为只有真正理解了整张图在讲什么故事,才能合理地猜出被遮住的部分。这项技术在帮助AI"读懂图像"方面效果极佳,但长期以来它主要用于训练能够理解图像的AI(判别模型),而不是生成图像的AI(生成模型)。
研究团队发现,这两项技术恰好可以互补:MIM擅长让AI理解图像的高层语义,NF擅长精确建模概率分布并生成图像,如果能把两者真正融合在一起,或许能突破NF的能力瓶颈。这就是MIMFlow诞生的动机。
二、把宴席工作拆开:MIMFlow的核心思路
MIMFlow的整体设计哲学可以用一个厨房分工的故事来理解。高端餐厅之所以能做出既有深度又精致美观的菜肴,靠的是一个清晰的分工体系:主厨负责整体菜品风格和核心口味设计,助厨团队负责具体的烹饪过程,摆盘师傅负责最后的视觉呈现。三者各司其职,互不干扰,但又紧密协作。
MIMFlow做的事情,本质上就是给图像生成建立这样一套分工体系。整个框架由三个核心模块组成,它们协同工作但分担不同的责任。
第一个模块是"掩码编码器",扮演的是主厨提炼风格的角色。这个编码器接收一张被随机遮住部分区域的图像作为输入,然后用一种特殊设计提炼出图像的核心语义。具体而言,研究团队在编码器里引入了一种叫做"可学习查询令牌"的设计——可以把它理解为一组特殊的"问题卡片",数量固定为128张。这128张问题卡片会在编码器内部的自注意力机制(一种让AI的每个部分都能"参考"其他所有部分的机制)中,主动向那些没有被遮住的图像区域"发问"、收集信息,最终每张卡片都浓缩了来自整张图的关键语义。最后,编码器只输出这128张问题卡片的处理结果作为"语义潜变量",而不是完整图像的所有信息。
这个设计有一个精妙之处:原始的256×256分辨率图像被划分成16×16=256个图像块,而这里只输出128个令牌,也就是说信息被主动压缩了一半。而且因为输入图像本身就有40%到60%的区域被遮住了,AI必须从残缺的信息中提炼出完整的语义理解,这天然地迫使编码器去关注那些真正重要的结构信息,而不是局部的像素细节。就像一个人如果只能看到一张照片的一半,他对"这张照片里有什么"的理解必然会高度依赖整体语境和结构,而不是局部纹理。
第二个模块是"标准化流",扮演的是主厨对整体风格建模的角色。它接收编码器输出的128个语义令牌,学习如何把这些令牌的分布映射到一个简单的高斯分布(可以理解为一种均匀分布的随机数池子)。在生成图像时,从这个随机数池子里采样,然后通过流的逆向过程得到一组语义令牌。由于这些令牌已经被掩码编码器剥离了像素级噪声,只保留了高层语义,NF不再需要同时处理"画面的整体故事"和"每根头发的走向",终于可以专心做好它最擅长的事:精确建模有意义的语义空间的概率分布。
第三个模块是"生成解码器",扮演的是负责最终呈现的摆盘师傅。它接收NF产生的语义令牌,然后通过跨模态注意力机制(一种让解码器既参考语义令牌,又结合可学习的图像位置嵌入的机制),把抽象的语义信息还原成具有丰富像素细节的完整图像。高频的纹理细节、精细的视觉质感,都由这个解码器专门负责。
这种分工的好处显而易见:负责概率建模的NF只需要应对一个结构清晰、语义明确的紧凑空间,而不是嘈杂的全像素空间;负责像素重建的解码器只需要专注纹理合成,而不必同时承担语义理解。两者的能力都得到了充分发挥。
三、数学支撑:为什么这样分工在理论上是合理的
MIMFlow在数学上建立在一个叫做"变分推断"(Variational Inference)的框架之上,不过读者完全不需要深入了解这个数学框架,只需要理解它想解决的问题。
简单来说,任何生成模型都希望回答一个问题:给定一张真实图像,我怎么计算出"这样的图像有多大概率存在"?同时,它还要有能力反过来:给定一个随机的数字,我怎么生成出一张看起来真实的图像?
MIMFlow把这个问题拆解成了两部分同时优化。一部分是"重建损失":把一张被遮住的图像输入编码器,得到语义令牌,再通过解码器重建出完整图像,用重建结果和原图的差距作为反馈来改进模型。重建损失由两部分组成:一部分是像素级别的均方误差(直接衡量每个像素有多接近),另一部分是感知损失(衡量视觉感知上的相似程度)。另一部分是"流损失":用NF来计算语义令牌的概率,让NF精确地知道什么样的语义令牌是合理的,什么样的是不合理的。
这两部分损失被同时优化,也就是说编码器、解码器、标准化流三个模块从头到尾一起训练,互相配合、互相促进——这种训练方式叫做"端到端训练"。相比之前那种先单独训练好图像编码解码器、再单独训练生成模型的"两段式"训练,端到端训练能确保编码器产生的语义空间天然适合NF去建模,而不是让NF去适应一个不是为它设计的潜在空间。
训练过程中还有一个小技巧值得一提:研究团队在语义令牌上加入了一点点随机噪声(数学上是高斯噪声,标准差σ=0.3是通过实验找到的最优值)。这个技巧的作用类似于给咖啡豆烘焙时增加一点"随机波动"——让最终的豆子批次更加稳定均匀,避免因为某些极端值影响整体质量。加入这个噪声让NF在学习概率分布时面对的是一个更加"平滑"的分布,训练更稳定,最终效果更好。
此外,MIMFlow还增加了一个辅助学习任务:在训练过程中,同时让一个轻量级的辅助解码器去预测来自DINO(一种专注于理解图像结构的预训练视觉模型)和CLIP(一种专注于理解图像与语言关系的预训练模型)的特征向量。这就相当于在教厨师烹饪的同时,还请了几位美食评论家来实时反馈"你对这道菜的整体风格理解是否准确"——通过这种额外监督,语义令牌被进一步推向更高层次的语义表达。实验发现,DINO和CLIP的组合效果最好,因为它们提供了互补的信息:DINO更擅长理解图像的结构,CLIP更擅长理解图像的语义类别。加入低层次特征如HOG(一种描述图像边缘的传统特征)则会导致训练崩溃,这进一步验证了MIMFlow的潜在空间天然排斥低层像素信息的特性。
四、最后的精修:对抗训练让图像更真实
端到端的联合训练阶段结束后,研究团队还增加了一个短暂但关键的"精修阶段"——对抗性微调。
这个阶段的工作原理类似于给一件精心缝制的衬衫做最后的熨烫和细节修整。联合训练阶段的解码器虽然能正确理解语义、生成结构合理的图像,但生成的图像往往看起来略微模糊,缺少那种让人感觉"栩栩如生"的高频纹理细节。原因在于均方误差这类重建损失有一种内在倾向:当不确定某个区域应该长什么样时,它倾向于输出一个"平均化"的结果,这在视觉上表现为模糊感。
对抗性微调引入了一个"评审员"网络(判别器),它的任务是判断一张图像是真实的还是AI生成的。解码器则努力生成能够骗过这个评审员的图像。这场猫鼠游戏迫使解码器学会生成更细腻、更真实的纹理细节。
精修阶段有一个精心的设计:编码器在这个阶段继续接收被遮住的图像作为输入(而不是完整图像)。这确保了解码器在精修阶段所接触到的语义令牌,和它在联合训练阶段所学到的语义令牌分布保持一致。如果精修阶段换成用完整图像,解码器接触到的令牌分布会发生变化,而NF是针对被遮住图像产生的令牌分布训练的,这种分布偏差会导致生成时的图像质量下降。整个精修阶段只需要额外训练2个轮次(相比联合训练的90个轮次),代价极小但效益显著。
五、实验结果:数字背后的故事
研究团队在图像生成领域最权威的基准数据集ImageNet(包含超过百万张来自1000个类别的真实图像)的256×256分辨率版本上验证了MIMFlow的性能。评估指标主要是FID(Fréchet Inception Distance,数值越低代表生成图像越接近真实图像分布,可以理解为一个衡量"真实感"的分数)和线性探测准确率(衡量AI学到的特征是否包含足够语义信息的一种测试,类似于考察学生"理解了多少课程内容"的测验)。
在NF家族内部的对比中,MIMFlow表现出了明显的进步。和参数量几乎相同(约480M参数)的SimFlow-L相比,MIMFlow-L的FID从3.72降低到了2.50,降幅达到32.8%。更引人注目的是,MIMFlow-L使用的参数量只有FAE-NF-XXL的约三分之一(482M对比1.4B),却取得了更好的FID(2.50对比2.67)。甚至和参数量是其约3倍、使用1024个令牌的STARFlow-XXL相比,MIMFlow-L的表现(FID 2.50)也非常接近(STARFlow-XXL为FID 2.40)。
令人印象深刻的是MIMFlow在没有外部引导(CFG,Classifier-Free Guidance,一种通过重复采样来提高生成质量的技术)时的表现。没有CFG时,MIMFlow-L的FID是3.64,而参数量是其约3倍的SimFlow-XXL在同样没有CFG时的FID高达10.13。这意味着MIMFlow学到的语义空间本身就更加结构化,不需要太多外部帮助就能产出高质量的图像。
线性探测准确率的数据则直接验证了MIMFlow在语义理解方面的提升。有掩码(0.4-0.6比例)的MIMFlow达到了71.3%的分类准确率,而完全没有掩码的相同架构只有56.6%——提升了将近15个百分点。这个差距清楚地说明,是掩码机制迫使模型更好地理解图像语义,而不是其他因素。
在生成图像的精确度方面,MIMFlow的Precision(精确率,衡量生成图像是否符合真实数据分布)达到了0.82,和众多扩散模型旗鼓相当,进一步证明了这个框架的有效性。
六、拆解细节:每个设计选择的意义
研究团队进行了大量的消融实验——也就是逐一"拆除"或改变设计中的各个部分,观察性能如何变化,以此验证每个设计选择的必要性。这些实验的结果非常清楚地讲述了各个设计选择背后的逻辑。
掩码策略的选择最为关键。完全不使用掩码时,生成FID高达29.0,而使用0.4-0.6比例掩码时FID降至12.82(此为50轮训练的结果,最终完整训练后达到2.50)。更有趣的是,掩码比例并非越高越好:0.6-0.8比例的掩码效果(gFID 15.92)反而不如0.4-0.6(gFID 12.82),过低的掩码比例(0.2-0.4)同样不理想(gFID 24.47)。混合策略(一半时间不掩码、一半时间掩码)表现最差(gFID 26.98)。这说明一个稳定、适度的信息瓶颈对于整个框架的语义聚焦至关重要——太少了效果不明显,太多了则导致语义信息本身也丢失得太严重,混合策略则破坏了训练时的一致性。
令牌数量的选择同样有一个明确的"甜点区"。64个令牌时重建效果略差(rFID 5.61),128个令牌达到最佳平衡(rFID 3.60,gFID 12.46)。但128个令牌之后会出现急剧恶化:192个令牌时gFID直接跌到30.42。研究团队对此给出了很直观的解释:256个图像块中约50%被遮住,剩余约128块的信息量恰好对应128个令牌的容量,这是一种自然的匹配关系。超过128个令牌意味着允许高频噪声重新渗入潜在空间,破坏了分工体系的根基。
关于噪声强度,σ=0.3是最优值:σ=0.2时流模型的训练流形不够平滑(gFID 14.30),σ=0.5时噪声过大导致重建质量明显下降(rFID 6.95,gFID 17.69)。而辅助监督的组合方面,DINO与CLIP的组合(gFID 12.46)优于只用DINO(gFID 12.89),加入HOG则会导致训练崩溃或明显退化,进一步确认了MIMFlow的潜在空间倾向于高层语义而拒绝低层纹理特征。
七、流的内部结构:一个有趣的发现
研究团队还做了一个有趣的分析:通过在NF不同深度的中间层提取特征,测试这些特征的线性分类准确率,来观察语义信息如何随着流的深度变化。
结果出乎意料却又合情合理:语义分类准确率在流的最初层级(来自编码器的输出层)最高,然后随着流的层数加深,准确率基本上保持平稳或略有下降,而不是持续提升。这说明NF本身并不具备像深度神经网络那样"越深层语义越抽象"的特性——它的强项在于精确的概率分布变换,而不是层层递进的语义抽象。这个发现从另一个角度证明了为什么MIMFlow的设计思路是合理的:把语义提取的任务交给专门设计的掩码编码器(MIM),把概率分布建模的任务交给NF,两者在各自擅长的领域各自发力。
八、效率的意外收获:更少的令牌,更快的速度
MIMFlow的128令牌设计带来了一个令人愉快的副产品:显著的计算效率提升。
研究团队在相同的硬件条件下对比了MIMFlow-L和SimFlow-L的效率表现。MIMFlow-L拥有约482M参数,比SimFlow-L的475M略多,但由于令牌数量从256减少到128,训练时的显存占用从52.3GB降低到了37.6GB,训练吞吐量从每秒2.83次迭代提升到3.11次,每张图像的采样时间从0.020秒降低到0.011秒(几乎减半)。更实际的是,显存需求的下降使得模型可以在8张A100(80GB)GPU上以256的批次大小进行训练,降低了硬件门槛。
如果把令牌数量进一步拉开到1024(一些其他NF方法的设置),对比会更加戏剧性:1024令牌相比128令牌,训练耗时是后者的8.3倍,推理耗时是后者的15.8倍。这种效率差距随着生成分辨率的提高会进一步扩大。
九、流场的健康体检:雅可比谱分析
为了从数学角度理解MIMFlow为何有效,研究团队还对NF内部的数学结构进行了一种叫做"雅可比谱分析"的检测。不需要理解具体的数学细节,只需要知道这种分析类似于对一台精密仪器进行"健康体检":检查它的工作是否稳健,有没有存在极端的情形会导致它失灵。
分析结果显示,MIMFlow的NF在三个关键指标上都优于直接对原始VAE潜变量操作的STARFlow:最大奇异值更集中(说明没有某些方向被过度拉伸)、最小奇异值更大且更稳定(说明映射更加健壮,不易出现"几乎奇异"的危险情形)、条件数(最大奇异值与最小奇异值的比值,比值越小说明映射越"健康")更低且分布更集中。
用直白的语言来说,这意味着MIMFlow的流变换更"温和"——它不需要在某些方向上进行极端的空间扭曲来适应复杂的像素分布,而是在一个相对平坦、结构清晰的语义空间中进行更加均匀的概率变换。这种"温和"的变换不仅在数值上更稳定,也在直觉上解释了为什么MIMFlow生成的图像更具有全局结构一致性。
归根结底,MIMFlow做的事情可以用一句话概括:它找到了一种让不同AI模块各司其职、分工协作的方式,解决了一个长期困扰图像生成领域的老问题——生成模型要么擅长"懂图像"但不擅长"画图像",要么擅长"画图像"但不擅长"懂图像"。通过引入掩码机制作为信息瓶颈,MIMFlow迫使编码器真正去"理解"图像,同时把精细绘制的工作交给专门的解码器,让作为连接两者的概率建模专家——标准化流——能够专心做好它最擅长的部分。最终的结果是,用只有竞争对手三分之一的参数量,在更少的令牌数下,取得了更好的生成质量,并且计算效率也同时提升了。
这项研究目前主要在学术基准(ImageNet 256×256)上验证,未来是否能扩展到更高分辨率或更多样化的真实应用场景,是一个值得继续观察的方向。另一个值得思考的问题是:掩码机制这种"有意为难"的训练策略,在其他类型的生成模型(比如扩散模型或自回归模型)中是否也能发挥类似的语义聚焦作用?有兴趣深入探究这些问题的读者,可以通过论文编号arXiv:2606.26016找到完整的技术细节和实验数据。
Q&A
Q1:MIMFlow框架和普通的图像生成AI有什么不同?
A:普通的图像生成AI(如扩散模型)通常分两步训练:先单独训练图像编码解码器,再训练生成模型。MIMFlow的不同之处在于把三个模块——掩码编码器、标准化流、生成解码器——同时端到端训练,而且通过遮住输入图像的40%-60%区域,迫使编码器专注于学习图像的整体语义而非局部像素细节,让标准化流只需要建模高层语义的分布,最终实现了用更少的参数(482M)和更少的令牌数(128个)达到更好的生成质量。
Q2:MIMFlow中的掩码比例为什么选0.4到0.6,太高或太低有什么问题?
A:实验表明,掩码比例在0.4-0.6时效果最佳(gFID 12.82,线性探测准确率71.3%)。掩码比例过低(0.2-0.4)时,信息瓶颈不够强,模型仍然能轻易从局部像素重建图像,语义聚焦效果弱(gFID 24.47)。掩码比例过高(0.6-0.8)时,被遮住的信息太多,连语义信息本身也大量丢失,模型难以提炼出有效表示(gFID 15.92)。完全不掩码时效果最差(gFID 29.0),说明掩码是MIMFlow取得性能的核心机制。
Q3:标准化流(Normalizing Flow)为什么会有容量瓶颈,MIMFlow如何解决?
A:标准化流因为严格的可逆性约束,必须同时处理图像中所有层次的信息——从整体语义到每个像素的微小变化。这导致模型的表达能力被分散:既要建模高层语义的分布,又要应对低层像素噪声的干扰。MIMFlow通过掩码编码器和可学习令牌瓶颈(128个令牌)预先剥离掉低频像素噪声,只把压缩后的语义令牌传递给标准化流,让流模型专心建模一个结构清晰的语义流形,从而从根本上缓解了这一容量瓶颈。
好文章,需要你的鼓励
这篇论文提出一种插件式2D动作接口,让已训练好的3D运动语言模型无需修改或微调即可直接理解2D姿态输入。实验证明2D输入效果媲美3D输入,且在真实视频场景下配合专门的降噪适配器,2D方案比3D姿态估计更省算力、更实用,为动作理解模型的现实部署提供了新路径。
研究团队让8种AI智能体独立完成100项真实科研任务,深度剖析800份研究轨迹后发现,即便是最强模型,也普遍存在"发现问题却不修正"的现象,背后根源指向AI缺乏检验自身产出、主动纠错的元认知能力。
WorldRover是一套面向可探索世界建模的合成视频数据引擎,基于虚幻引擎构建,能让同一段探索轨迹在保持路线与场景一致的前提下,重新渲染为多种视角和外观状态,并同步提供深度、光流、长程点追踪等丰富标注,最终发布WorldRover-10M数据集,含2190万帧、202.7小时视频。
这篇论文指出,现有多目标强化学习训练大模型时存在"一刀切"分配优化精力的问题,提出SA-MRPO方法,根据每个奖励目标的饱和程度动态调整其权重,在数学推理、自适应推理、代码生成等任务上均取得优于现有方法GDPO的效果。