
这项由阿里巴巴集团研究团队主导完成的研究,于2026年6月公开发表,论文编号为arXiv:2606.03746,有兴趣深入了解的读者可以通过该编号查询完整论文。
当你用手机上的图像生成应用一键生成精美图片时,背后往往有一个"快速版"的AI模型在工作。这种快速版模型是怎么来的?简单说,就是让一个"慢但能力强"的老师AI,把自己的本领传授给一个"快但还嫩"的学生AI,这个过程在学术上叫做"知识蒸馏"。
然而,研究团队在实际操作中发现了一个让人头疼的怪现象:按照教科书上的方法给学生AI安排课程,学生的成绩却总是差强人意,尤其是在生成带有复杂文字的图片时,效果简直一塌糊涂。这就好像一个本来天赋不错的学生,因为老师给的教材不对路,反而越学越退步。
这个困境促使研究团队重新审视一个被大家长期忽视的问题:在培养学生AI的过程中,除了选什么样的"教学方法"之外,怎么安排整个"培训课程"同样至关重要。于是,他们系统地研究了三个核心问题:练习题的选择(数据组合)、如何利用多位能力各异的老师(教师引导)、以及如何同时教会学生画图和改图(任务混合)。
基于这些研究,他们最终开发出了一个叫做**Qwen-Image-Flash**的统一快速模型,只需要4次"思考步骤"(行话叫NFE,即函数评估次数),就能生成高质量图片或完成图片编辑,相比原来需要80次思考步骤的老师AI,速度提升了20倍。
---
一、学会"知识蒸馏":从慢师傅到快徒弟的那门手艺
要理解这项研究,得先弄明白"知识蒸馏"这件事。
现代AI图像生成模型的工作方式,可以用做菜来理解。生成一张图片,就像是把一锅乱炖的食材(随机噪声),一步一步烹饪精炼成一道精致菜肴(最终图片)。越是慢工出细活,菜就越好;但客人等不了那么久。
"老师AI"就是那位会做80道工序的大厨,每一步都精雕细琢,最后端出的菜美味至极,但上菜要很久。"学生AI"的目标,是只用4道工序就做出类似水准的菜——这当然需要一定的诀窍,而这些诀窍就是从老师那里"蒸馏"而来的。
这项研究采用的核心技术框架叫做"流匹配"(Flow Matching)和"分布匹配蒸馏"(DMD)。流匹配可以理解为:老师AI掌握了一套精确的"菜谱",描述了如何一步步把原材料变成美食;DMD则是一套让学生AI学会模仿老师出品的训练机制。具体来说,DMD会不断比较学生做出来的菜和老师做出来的菜在各个阶段的状态差异,然后告诉学生"你这步火候大了"或"那步盐少了",推着学生向老师的水准靠拢。
老师模型是阿里巴巴的Qwen-Image-2.0,这是一个经过大规模训练、能力全面的图像生成模型。研究团队从这位"大厨"出发,系统研究如何高效地把它的本领传授给只有4步操作时间的快速学生模型。
---
二、练习题选错了,越练越差——数据组合的反常真相
培训学生AI,需要给它安排练习题。你可能觉得,要让学生学会画带文字的海报,就应该多给它出带文字的练习题;要让它全面发展,就应该涵盖各种类型的题目。研究团队最初也是这么想的,但实验结果彻底推翻了这个"常识"。
研究团队用中文大语言模型Qwen3生成了三类练习题提示词,每类2万道,分别是:风景类(山川湖海、自然美景)、人像类(人物肖像、生活场景)和文字类(需要在图片中渲染清晰文字的场景,比如海报、招牌)。接着,他们设计了五种不同的练习题搭配方案,让五个学生AI分别在这五套课程下训练相同的时间,然后统一参加考试。
考试叫做T2I-Bench,是研究团队专门设计的评估标准,包含1800道测试题,涵盖风景、人像、文字三个类别各600道,由两位"考官"——Gemini 3.1 Pro和GPT 5.5这两个强大的AI——来给生成图片打分,满分5分。
结果出来,让所有人目瞪口呆。
专门做文字类练习题的学生(E3),在文字类考题上的成绩,居然不如那些从来没做过文字练习题的学生——比如只做风景类练习的学生(E1)和只做人像类练习的学生(E2)。E1和E2这两个从没见过文字练习的学生,在文字考题上拿到了3.77和3.76的GPT评分;而满满一箱文字练习题喂出来的E3,文字考题只得了2.64分。
更惊人的还在后面。研究团队把三类题目混在一起,组成了"全类型混合练习"(E5),用了整整6万道题——是单类练习的三倍!然而E5的平均成绩只有3.62分,还不如只用2万道人像题练出来的E2的4.15分。练习题越多越杂,结果反而越差。
为什么会这样?研究团队给出了一个合理的解释:知识蒸馏与大规模预训练有本质的不同。预训练时,给AI看海量多样化的数据,是让它建立对世界的广泛认知,多多益善。但知识蒸馏是一个更精细的过程——学生AI的"学习容量"受限,它的学习轨迹也很短(只有4步),所以练习题不仅仅是"示例",更是决定了老师的知识以什么样的方式传递给学生。
文字类练习题之所以有害,很可能是因为:带密集文字的图像分布极为特殊,和普通图像相差很大。当学生AI在这种高度特化的练习下训练时,老师的分布引导和学生自身的分布之间发生了严重的"水土不服",导致整体的知识传递过程受损,连学生原本能掌握的技能也一并退步了。
反之,风景和人像这类练习题,图像分布相对干净、统一、连贯,为学生AI提供了一个稳定、高质量的学习环境。在这个清晰的环境下,老师的知识能够更顺畅地传递,甚至能让学生在从未练习过的文字类场景中也表现出色——因为学生真正学到的是更底层的视觉合成能力,而不只是在模仿特定类型的练习题。
这个发现的意义在于:在给AI学生准备练习题时,直觉上"对症下药"的做法可能适得其反。数据的整洁性和一致性,比数据的覆盖范围更重要。这和普通人的学习有时候也有共通之处——有些学生在一个安静专注的环境下学一门课,反而能触类旁通,比在嘈杂的综合辅导班里学十门课效果更好。
---
三、换一位"严格专科老师",学生反而崩溃了——多老师引导的稳定之道
练习题的问题解决了,研究团队又遇到了第二个难题:老师的选择。
在这项研究中,"老师"并非只有一位。研究团队手边有两类老师:一类是"通才老师"Qwen-Image-2.0-Base,它在各种图像生成任务上都表现得不错,但并非每个方向都是顶尖水平;另一类是"专科老师"Qwen-Image-2.0-Task-Specialized,它经过专门的强化训练,在特定任务(比如文字渲染、特定风格)上的水准明显高于通才老师。
自然的想法是:既然专科老师在目标任务上更强,就让专科老师来指导学生,这样学生岂不是能学到更好的本领?
实验结果再次令人大跌眼镜。研究团队把学生AI换成专科老师来指导,训练过程一开始还稍有改善,但很快就出现了"训练崩溃"的现象:学生生成的图片越来越乱,结构扭曲,内容与提示词对不上,视觉质量急剧下降。到训练中后期,生成的图片已经惨不忍睹。
这就像是给一个还在学基础技法的画画学生,突然换成了一位极度追求某种特定风格的大师来指导。大师本人的作品固然惊艳,但他对细节的极致追求、对特定风格的高度专注,形成了一种极为"窄而深"的分布——他只认可符合自己审美的画,对学生的任何"普通"作品都嗤之以鼻。学生在这种高压且方向极为集中的指导下,反而无所适从,连基本的技法都乱了。
专科老师的问题在于:它学到的图像分布非常尖锐和集中,与学生AI当前能产出的图像分布之间,存在巨大的"代沟"。DMD框架依赖的是老师的"评分函数"和学生自身分布的比较,这个代沟越大,给学生的更新信号就越混乱,最终导致优化失稳。
研究团队由此提出了一个叫做"逐步多老师引导"的方案。这个方案的核心思路是:不抛弃通才老师,而是让通才老师和专科老师携手合作,在不同的学习阶段、针对不同的任务内容,以不同的比例共同引导学生。具体来说,在学习过程的早期,主要依赖通才老师提供稳定的基础引导,就像先打好基本功;随着学习推进,再逐步引入专科老师针对特定任务的专业意见。这种引导信号的加权组合,在数学上被表示为各位老师"评分函数"的加权平均。
训练过程中,通才老师始终扮演"稳定锚"的角色,防止学生的学习轨迹偏离合理范围;专科老师则在合适的时机"点拨"学生,让它在特定任务上获得进步。两者之间的权重,由当前所处的学习步骤和具体的任务条件共同决定。
效果非常显著。采用多老师逐步引导的学生,整个训练过程保持稳定,生成的图片始终保持清晰的结构和语义一致性,再也没有出现"训练崩溃"的情形。
最终,这个只需4步就能生成图片的学生模型(Qwen-Image-Flash-T2I),在风景、人像、文字三类测试中取得了平均3.56分(Gemini评分)和4.15分(GPT评分),不仅没有因为步骤数极少而拉低分数,甚至在整体排名上超过了需要80步的通才老师(平均3.41/4.09分),与专科老师的差距也大幅缩小。这说明多老师逐步引导的策略,成功把两位老师的长处都传递给了学生,而且整个传递过程保持了高度的稳定性。
---
四、同时教"画画"和"改图",比例错了两头落空——生成与编辑的联合蒸馏
解决了练习题选择和老师引导的问题之后,研究团队面临最后一个挑战:Qwen-Image-Flash不仅要会"无中生有"地生成图片,还要能够根据用户的文字指令来修改一张已有的图片——比如把照片里的背景换成白色、把人物的表情改成微笑、把牌匾上的某行文字替换掉。
"图片生成"和"图片编辑"这两个技能,就像是同一个人既要学会画画,又要学会修图。单独学一样,相对容易。同时学两样,就需要精心安排课程,避免顾此失彼。
研究团队首先构建了一个专门的编辑能力测试标准,叫做Editing-Bench,包含1500道测试题,涵盖六大类编辑任务:场景级语义转换(比如把晴天改成雨天)、感知增强(修复老照片、提升画质)、以对象为中心的操控(删除某个物体、替换某个物体)、文字内容编辑(修改图片里的文字)、保留身份的编辑(改变发型但保持人脸一致)、以及风格迁移(把照片变成油画风格)。每类250道题,同样由Gemini 3.1 Pro和GPT 5.5打分。
研究团队设计了三种不同的"画图与改图练习题配比",分别是:画图题和改图题的比例为9:1、7:3、5:5,然后分别训练学生,再统一参加画图考试(T2I-Bench)和改图考试(Editing-Bench)。
首先,研究团队测试了一个有趣的假设:如果一个学生只学过"画画",从没做过"改图"练习,它在改图考试中能得几分?出人意料的是,只做过画图练习的学生(即之前训练好的Qwen-Image-Flash-T2I),拿去直接参加改图考试,居然也得了2.77分(Gemini评分)和3.28分(GPT评分)——不是零分,甚至在某些改图类别上表现还不差。这说明图像生成能力和图像编辑能力之间有相当的共通之处,底层的视觉理解能力可以跨任务迁移。
然而,这种"顺带会改图"的能力是有明显短板的,特别是在需要精确文字操作的改图任务上,纯画图学生的表现明显弱于专科老师的直接输出。这说明仅靠画图训练,并不足以充分继承老师的改图能力。
接下来,实验结果又揭示了一个微妙的规律。配比为9:1(几乎全是画图题,只有一点点改图题)的学生,改图成绩不仅没提高,反而还比纯画图学生更差。这是个"东施效颦"的反效果:改图数据太少,连稳定的改图学习信号都形成不了,反而干扰了原本画图能力的传递,两头都不讨好。
当改图题的比例提升到3成(7:3)时,改图成绩明显回升,超过了纯画图学生,也超过了专科老师的直接输出(Gemini评分)。当改图题和画图题各占一半(5:5)时,改图成绩达到最高,在多个类别上都超越了专科老师,平均Gemini评分从纯画图的2.77提升到2.97,GPT评分从3.28提升到3.41。
换句话说,改图练习题的比例存在一个"甜蜜点":太少了,不够触发改图技能的学习;足够多了,就能让学生真正掌握改图本领,同时对画图能力也没有损害。
后面这一点尤其值得关注。你可能会担心:加了这么多改图练习,画图技能会不会退步?研究团队专门统计了所有配比下学生在T2I-Bench(画图考试)上的成绩,发现一个令人欣喜的结果:所有加了改图练习的学生,在画图考试上的平均成绩,反而都比纯画图训练的学生更高。5:5配比的学生,Gemini画图评分达到3.65,GPT评分4.16,均高于纯画图学生的3.56和4.15。
这说明"改图"练习不只是在教学生怎么改图,它实际上也在强化学生理解图文关系的能力。改图任务要求模型精确理解指令,定位需要修改的区域,同时保留不需要动的部分,还要让修改结果和整体画面和谐统一。这些能力训练出来之后,同样有助于提升从文字描述生成图片的精确度和一致性——两者是相辅相成的,而不是相互竞争的。
最终,研究团队选定5:5作为最优配比,训练出来的就是正式发布的Qwen-Image-Flash。
---
五、那些"试过没成功"的方案,和还没解决的遗留问题
研究团队在论文中诚实地记录了一些尝试过但没能成功的方向,这种透明度在学术研究中颇为难得。
既然直接用专科老师当引导会导致训练崩溃,一个自然的补救思路是:在训练的第一步加一个额外的"结构约束",让学生在最早的生成步骤就能维持合理的布局和构图,避免后续被专科老师的极端分布"带偏"。这个方法的灵感来自另一项叫做DP-DMD的研究,其核心是在生成的第一步施加一个额外的"对齐损失"。
实验证明这个方法确实部分有效:训练过程中的结构崩溃现象减少了,布局更稳定了。然而,伴随而来的是视觉质量的些许下滑。第一步的结构约束相当于给学生套上了一个"紧箍咒",限制了它从专科老师那里接受特化引导的空间,两者之间产生了难以消除的权衡。研究团队最终没有采用这一方法,而是选择了逐步多老师引导的方案。
此外,研究团队也坦承Qwen-Image-Flash仍然存在两个主要的局限。第一个是复杂文字渲染问题:对于需要在图片中精确呈现大量密集文字的场景,比如密密麻麻的信息图、小字海报,模型在字符形状、间距和排版上仍然容易出错。这类场景本来就是生成AI的难题,而4步的生成过程更是进一步压缩了模型精细处理的空间。
第二个是残留噪声问题:在加入改图练习数据之后,部分画图输出在大面积干净背景(比如纯白背景)上会出现轻微的噪点。这可能是因为改图任务和画图任务的去噪轨迹略有不同,而在极少的步骤数下,模型有时未能完全完成去噪过程。有趣的是,研究团队指出这并非Qwen-Image-Flash独有的现象,在GPT Image 2等近期强大的图像生成系统中也能观察到类似的轻微噪声。这个问题在以纯净背景和精确排版为核心诉求的场景(如商业海报制作)中比较碍眼,但在内容丰富的场景中有时反而增加了一些真实感和纹理感。
---
说到底,这项研究传达的核心信息其实很朴素:工具再好,用法不对,也发挥不出效果。研究团队花了大量精力研究一个大家默认不是问题的问题——"怎么安排学生AI的训练课程"——结果发现这件事的影响居然比他们选用什么样的核心训练算法还要大。
练习题的选择上,"多即是好"的朴素直觉在这里完全失效,反而是更简单、更干净的单一类型练习,能够让老师的知识更顺畅地流入学生。老师的选择上,"更强必然更好"同样是个陷阱,过于专精的老师会让训练陷入混乱,反而需要通才老师来充当稳定器。任务的组合上,画图和改图这两件看似矛盾的事,在比例合适的时候不仅能共存,还能相互促进。
Qwen-Image-Flash的最终成品,用4步走完了原来80步才能完成的路,画图能力超越了自己的通才老师,改图能力在多个维度超越了专科老师。这让研究团队相信,未来高效视觉AI的进步,不会只靠算法本身的突破,而更需要对整个训练体系的系统性理解和精心设计。
对于对这一领域感兴趣的读者,可以通过论文编号arXiv:2606.03746查阅完整研究,其中包含了详细的实验数据、评估基准的完整说明,以及两套专门设计的测试标准T2I-Bench和Editing-Bench的具体构成,这些基准本身也可以作为后续研究的参考工具。
---
Q&A
Q1:Qwen-Image-Flash和普通图像生成模型有什么区别?
A:Qwen-Image-Flash是一个"快速蒸馏版"模型,普通图像生成模型需要80步才能生成一张图,而Qwen-Image-Flash只需要4步,速度快了约20倍。它同时支持文字生成图片和根据指令修改图片两种功能,是阿里巴巴Qwen-Image系列的高效版本。
Q2:为什么给AI模型添加更多训练数据反而会变差?
A:在知识蒸馏这个特殊场景里,数据不只是"示例",它决定了老师的知识以什么方式传递给学生。某些类型的数据(比如复杂文字图像)分布特殊,会造成老师和学生之间的"水土不服",干扰整体的知识传递。简单说,数据的整洁和一致,比数量和覆盖面更重要。
Q3:Qwen-Image-Flash图片编辑功能具体能做什么?
A:Qwen-Image-Flash支持六大类图片编辑:把场景改成另一种场景(比如晴天改雨天)、修复和提升图片画质、添加或删除图片中的物体、修改图片中的文字内容、在改变发型妆容时保持人脸身份不变、以及把照片转换成特定艺术风格。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。