
这项由法国AI研究机构Kyutai与美国加州大学伯克利分校联合开展的研究,以预印本形式于2026年6月18日发布在arXiv平台,编号为arXiv:2606.20536。感兴趣的读者可以通过这个编号在arXiv上找到完整论文。
每隔一段时间,AI图像生成领域就会涌现出新的"世界最强"模型。发布这些模型的论文通常会附上一个叫做FID的评分,用来衡量生成图片的质量。这个数字越小,意味着生成的图片越逼真、越多样。研究团队为了拿到更低的FID,往往要花费数百万美元的算力,反复调整模型结构和训练参数,最后发现自己的模型比竞争对手低了0.3分——然后宣称"实现了突破"。
但这个数字真的那么可靠吗?Kyutai与UC Berkeley的研究人员决定正面回答这个问题。他们发现,FID评分其实深深埋藏着一种随机性,这种随机性并非来自模型本身的缺陷,而是来自训练过程中大量"抽签"行为的累积效果。更令人惊讶的是,这种随机性的量级,完全足以让一个"普通"模型伪装成"顶尖"模型——只要抽到了一张好签。
研究团队训练了数百个规模不同的图像生成网络,系统地测量这种随机波动究竟有多大,并给出了一套更可靠的评估建议。
**一、每次训练都是一次抽签——而你只知道结果,不知道运气**
要理解这项研究,先来理解AI模型的训练过程是怎么回事。
训练一个图像生成模型,可以理解为让一个学生从海量图片中学习"什么是好看的图片"。这个过程涉及三个关键的随机决定:第一,学生一开始的知识状态是随机初始化的,每次开始学习时,脑子里装的是完全不同的"初始印象";第二,学生接触图片的顺序每次都不一样,今天先看猫、明天先看狗,学习路径截然不同;第三,在每一步学习中,模型会引入一个随机的"噪声注入"——这是流匹配损失函数(一种让模型学习如何从噪声中恢复图片的机制)的核心机制,每个训练步骤都会重新抽一次随机噪声,永远不会稳定下来。
研究团队把这三种随机因素合称为"训练抽签"。每次用同一套训练配方训练模型,相当于抽一张签,签的结果决定了你最终得到哪个版本的训练好的模型。即使配方完全相同,不同的签会产生FID评分截然不同的模型。
与训练抽签并行的,还有一个"生成抽签"。当模型训练好之后,每次生成图片,也需要抽一个随机起始噪声。不同的起始噪声会产生不同的图片集合,进而影响FID评分。业界通常会对这个生成抽签做多次重复,然后取平均值,以减少这部分的随机误差。
研究团队把整个评估过程比作两台老虎机:左边那台代表训练抽签,一旦拉动就产生一个训练好的模型;右边那台代表生成抽签,拉动一次产生一批生成图片,打一次分数。绝大多数论文只对右边那台机器拉了几次,就报告结果,完全忽视了左边那台机器带来的巨大不确定性。
**二、训练的随机性比生成的随机性大3.2倍——这意味着什么**
研究团队选择了一种叫做SiT(可扩展插值变换器)的图像生成架构,在ImageNet数据集(一个包含超过百万张标注图片的标准测试平台)上进行了大规模实验。他们训练了25个完全相同配方但不同随机种子的SiT-B/2模型,每个模型再用10个不同的生成种子来打分,总共产生了250个FID评分数据点。
结果让人目瞪口呆。在固定某一个训练好的模型上,用10个不同的生成种子打出的FID分数,标准差大约是0.14——这是生成随机性的量级。而25个不同训练种子产生的模型,它们各自平均FID的标准差高达0.44——这是训练随机性的量级。两者之比恰好是3.2倍。
换句话说:你以为你在评估模型的能力,但实际上你评估的有四分之三是运气。
更直观地说,25个模型里最幸运的那个FID是33.59,最倒霉的那个是35.69,差距超过2分——这完全是同一套配方、同一套训练流程、只是随机种子不同造成的。而许多在学术界引起轰动的"突破性进展",声称的FID改进不过是0.3到0.5分。这意味着,一个新方法声称的进步,完全可能被一个幸运的随机种子制造出来,并不代表真正的技术进步。
**三、三个抽签来源,各自贡献多少?**
知道了训练随机性的总量,下一步是弄清楚它来自哪里——是初始化、数据顺序,还是训练噪声?
研究团队设计了一组精巧的对照实验,每次只开放三个随机来源中的一个,另外两个固定不变。结果揭示了一个与直觉相悖的排名。
最大的随机性来源,不是大家通常以为的初始化权重,而是训练噪声——那个在流匹配损失中每步都重新抽取的随机高斯噪声。仅靠变化训练噪声,就能重现完整随机性的77%。初始化权重排第二,贡献了67%。数据顺序排第三,贡献了51%。
这个发现很有意思:当人们说"不同的随机种子产生不同结果"时,通常以为主要原因是初始化权重不同——就像两个学生一开始的基础知识储备不同。但实际上,更重要的因素是每一步学习过程中引入的随机噪声。这种噪声不会随着训练时间增长而消失,而是持续不断地注入,永远不会稳定。
此外,三个来源的效果并不是简单相加的。如果把三个来源的标准差平方求和再开方,会得到0.50,但实测的完整随机标准差只有0.44,低了14%。这说明三个来源之间存在相互作用,单独消除任何一个来源能减少的方差,都会被其他来源的存在部分抵消。
还有一个令人放心的发现:研究团队测试了在多个GPU并行训练时产生的硬件级数值不确定性(浮点运算顺序不固定导致的微小差异)对FID的影响。结果表明这种影响完全可以忽略不计——即使不同训练跑产生的模型权重差异了约5%到6%,FID评分几乎纹丝不动。真正的随机性来自有意设计的随机化步骤,而非硬件噪声。
**四、更聪明的评分方式:为每个模型量身定制引导强度**
AI图像生成中有一个重要技术叫做分类器自由引导(Classifier-Free Guidance,CFG)。可以把它理解为一个"风格放大器":数值越高,生成的图片越符合你指定的类别,细节越精致,但多样性也会下降。不同的模型、不同的训练种子,对这个放大器的最佳设置是不同的。
通常的做法是给所有模型用同一个CFG值来打分。但研究团队提出了一个更精细的方案——GS-FID(黄金分割FID):用黄金分割搜索算法为每一个(训练种子,生成种子)组合独立寻找最优CFG值,然后在这个最优CFG下打分。
黄金分割搜索是一种非常高效的搜索方法,类似于在一条弯曲的山路上找最低点——每次试探两个点,然后抛弃更高的那一侧,反复缩小搜索范围。这种方法能在大约14次FID评估内找到每个组合的最优CFG值,效率很高。
结果表明,GS-FID确实有效:训练随机性导致的相对标准差从1.26%下降到了0.67%,大约减少了一半。绝对FID均值也从约34.7大幅下降到约7.4——这是因为最优CFG带来了质量上的显著提升。
然而,GS-FID也带来了一个棘手的副作用:它重新洗牌了哪些训练种子"表现最好"。在没有引导的情况下排名靠前的种子,加入最优CFG之后可能滑落到中间;反之亦然。25个训练种子在无引导排名和GS-FID排名之间的斯皮尔曼相关系数(一种衡量排名一致性的指标)只有0.73——也就是说,有大约27%的排名差异无法用无引导成绩预测。其中8个种子的排名变化超过5位。
这个发现意味着:如果一篇论文用无引导FID筛选出"最好"的模型版本,然后再报告这个版本的CFG-FID,这两套结果使用了不同的"最优"标准,不能混为一谈。
**五、更多算力能解决这个问题吗?答案令人沮丧**
面对训练随机性带来的噪声,一个自然的想法是:训练更久、用更大的模型,随机性会不会平均掉?
研究团队对SiT的四个规模(从小到大分别是S、B、L、XL)进行了从20万步到200万步的完整训练,每隔10万步评估一次,总共产生了76个(模型规模,训练步数)的组合数据点,每个组合有25个训练种子、10个生成种子。
结果显示,随机性的相对水平——即标准差除以均值,也就是变异系数(CoV)——在整个实验范围内始终维持在1%到2%之间,中位数恰好是1.30%。训练步数增加了10倍,FID均值确实大幅下降,但CoV几乎纹丝不动。更大的模型也没有带来更低的变异系数——SiT-L的CoV反而高于SiT-S。
这意味着:训练随机性是一个与计算规模无关的噪声底线。你花再多钱训练更久、买更大的模型,这个噪声水平不会消失,只是套在一个更低的FID均值上而已。如果一篇论文声称的FID改进幅度小于均值的2%(大约相当于FID改进3%到4%),那这个改进完全可能落在随机波动范围之内,不能认为是真实的技术进步。
还有一个有趣的发现:种子排名的稳定性在训练早期非常差。用100万步时的排名来预测200万步时的排名,斯皮尔曼相关系数只有0.39到0.61——这意味着在训练的前半段,种子的表现几乎是随机的,根本无法凭借早期成绩来判断哪个种子最终会"赢"。到了约100万步之后,排名才逐渐稳定,到200万步时完全确定。
**六、运气好的种子,可以省下一半的训练时间**
研究团队还做了一个直观的计算:假设你有20到25个不同的训练种子,最"幸运"的那个种子能在什么时候达到最"倒霉"种子到200万步时才能达到的FID水平?
在最小的SiT-S和中等的SiT-B上,幸运种子只需要约160万步就能达到倒霉种子200万步的水平,节省了大约1.25倍的算力。在更大的SiT-L上,这个比例达到了1.82倍。在最大的SiT-XL上,这个比例高达2倍——幸运种子在100万步时就能达到倒霉种子200万步时的水平。
这个发现有深刻的现实含义。如果一篇论文声称某个新架构或训练技巧让训练速度提升了1.3倍,研究团队指出:纯靠换一个随机种子,在SiT-XL上就能获得2倍的"免费"提速,根本不需要改任何代码。换句话说,很多声称"训练效率提升"的结果,可能根本无法与随机种子带来的运气区分开来。
**七、那么,怎么才算公平地评分?**
研究团队基于所有这些发现,提出了一套更合理的评估建议。
多次生成不能替代多次训练。用同一个训练好的模型生成更多图片,只能减小生成随机性导致的误差,完全无法触及训练随机性这个更大的噪声来源。唯一能真正缩小置信区间的方法,是多次用不同种子训练模型,然后汇报均值和误差范围。
任何低于约2%的FID差异都应被视为不确定结果。在对比两个方法时,如果它们的FID差距低于FID均值的2%,这个差距极有可能只是随机种子的运气差异,不代表方法本身的优劣。研究团队给出了一张便查图表,对于任何给定的FID数值,可以直接读出单训练种子、5个种子、10个种子、25个种子情况下的95%置信区间。
以FID约为15分(一个训练充分的中型模型典型水平)为例,单个训练种子的95%置信区间大约是±0.38分。而学术界里经常被报告为"显著进展"的差距,往往只有0.1分——这个差距比置信区间小了将近4倍,完全淹没在噪声里。要把这个置信区间压缩到±0.1分以内,需要至少25个独立训练种子。
在使用分类器自由引导时,应为每个种子独立搜索最优引导强度,并报告搜索容差。研究团队的GS-FID协议提供了一个标准化的做法:黄金分割搜索能在约14次FID评估内找到每个种子的最优CFG值,结果更可靠,也更具可比性。但要注意,用无引导FID挑选种子之后再报告引导FID,这两套结果不应混用。
**八、这不只是FID的问题——其他评估指标也受影响**
研究团队还测试了这些发现在其他评估指标下是否成立。他们检验了DINOv2-FID(用不同的图像特征提取器计算的同类指标)以及四个基于近邻搜索的精细指标:精确率、召回率、密度和覆盖率。
DINOv2-FID的情况更加极端:训练随机性比生成随机性大4.82倍,比Inception-FID的3.19倍更高。这说明换用不同的特征提取器并不能减轻随机性问题,有时反而会放大它。
精确率、密度和覆盖率这三个指标也显示训练随机性与生成随机性大致相当,这意味着对这些指标而言,报告生成种子的置信区间至少能覆盖大约一半的真实不确定性。
召回率是唯一的例外。召回率衡量的是模型生成图片的多样性——具体来说,它问的是"真实图片集里的每张图,能不能找到一张相似的生成图?"。这个指标的计算方式比较特殊:它用生成图片集来建立搜索球,而不是用真实图片集。这意味着每次生成不同的图片集,搜索球的形状就完全变了,导致生成随机性反而比训练随机性大了3倍以上。对于召回率而言,报告生成种子的置信区间才是正确做法,报告训练种子的变化几乎没有意义。
说到底,这项研究揭示的是一个学界长期忽视的结构性问题:我们用来判断AI进步的标尺,本身就在抖动。每次报告一个FID数字,背后其实藏着一张没人知道好坏的彩票。训练随机性的相对噪声底线大约是均值的1%到2%,这个数字跨越了从小模型到大模型、从早期训练到充分收敛的所有情况,像一条顽固的水位线,无论你怎么加水(算力)都无法让它消失。
这对整个领域意味着什么?那些用单个FID数字声称"新方法比旧方法好"的论文,其可信度需要重新审视。一个只训练一次、只用一个生成种子评估的结果,实际上是一个置信区间极宽的随机样本,不足以作为判断优劣的依据。这就像凭借抛硬币一次的结果来断言某枚硬币是否公平,样本量根本不够。
当然,这项研究也有自身的局限:它只在SiT架构、流匹配训练目标、ImageNet数据集、Inception-V3特征计算的FID这一特定组合上进行了系统测量。其他模型家族、其他训练方法、其他数据集上的随机性量级可能有所不同,1.3%这个CoV数字是这个特定组合的校准值,不是普世常数。未来的研究需要在更多组合上重复这套测量,才能建立更完整的校准图谱。
但无论如何,下次看到某篇论文宣布FID又低了0.2分,可以先问一句:他们用了几个训练种子?如果答案是"一个",那这个数字很可能只是一张幸运彩票的背面,而不是真正的技术进步的证明。有兴趣深入研究这个问题的读者,可以通过arXiv:2606.20536查阅完整论文,研究团队还提供了在线计算工具,输入任意FID数值和训练种子数量,即可获得对应的95%置信区间估算。
Q&A
Q1:FID评分到底是什么,为什么AI图像生成领域这么看重它?
A:FID(Fréchet Inception Distance,弗雷歇特初始距离)是目前图像生成领域最主流的评估指标。它的工作原理是:用一个叫做Inception-V3的图像分类网络分别提取真实图片和生成图片的特征,然后比较这两组特征的统计分布差异。差异越小,FID就越低,说明生成图片越接近真实图片的分布。FID之所以被广泛使用,是因为它能同时衡量图片质量和多样性,而且积累了大量历史数据便于横向比较。
Q2:为什么增加算力、训练更大的模型无法减少FID的随机波动?
A:这是因为FID随机波动的根源在于流匹配损失函数的工作机制——它在每个训练步骤都会重新抽取一个随机噪声,这个过程永远不会稳定下来。无论训练多少步,这种噪声都持续注入。更大的模型有更多参数,但噪声注入的频率和幅度不变,所以相对波动水平(变异系数)保持在1%到2%的区间内,不随规模或算力的增加而缩小。
Q3:论文建议的GS-FID方法在实际使用中成本高吗?
A:GS-FID的核心操作是为每一个训练种子和生成种子的组合,用黄金分割搜索找到最优的分类器自由引导强度。每个组合大约需要14次FID评估。对于论文中使用的25个训练种子和10个生成种子的面板,总共需要约3500次额外的FID评估。这对于日常快速实验来说成本较高,但研究团队认为这是获得更可靠比较结果的必要代价。此外,GS-FID还会改变种子排名,因此评估和筛选必须在同一套协议下进行才有意义。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。