
你有没有想过一件事:现在几乎所有能打的文生图模型,比如Stable Diffusion、FLUX、Seedream,背后都藏着一个共同的秘密武器,叫做VAE。
这个秘密武器做的事情说起来挺朴素:先把一张1024×1024的图片压缩成一个小得多的"潜空间表示",模型在这个小空间里去学习、去生成,最后再靠VAE把结果解压还原成图片。这就好比你要装修一整栋别墅,先在缩尺模型上把所有家具摆放、颜色搭配都试一遍,确定没问题了,再按图施工到真实空间里。
这套流程确实好用,几乎所有大厂的图像生成模型都在用。但阿里巴巴Token Hub这次的研究,把一个大家心照不宣、但很少有人认真算过账的问题摆上了台面:这个"缩尺模型"到底有没有代价?如果我们绕开它,直接在像素空间里训练和生成,会发生什么?
结果比想象中要复杂得多。他们发现,直接在像素空间里从零开始预训练,收敛速度慢得让人心疼。但如果换一个思路,先在潜空间里练好基本功,再把模型"转移"到像素空间去,效果反而能反超潜空间模型,同时推理速度还能快上3到接近5倍。
这篇论文的价值不在于提出了一个多么炫酷的新架构,而在于把这条"潜空间到像素空间"的转换路径上,每一个容易踩坑的细节都认真测了一遍,给出了一份可以照着抄的操作手册。
潜空间的降维压缩:是效率神器,还是隐藏的天花板?
要理解这篇论文在争论什么,得先弄明白潜空间和像素空间到底差在哪。
潜空间扩散模型(Latent Diffusion Model,简称LDM):先用一个预训练好的自编码器(VAE)把图像压缩成低维的"潜在表示",扩散过程在这个压缩后的空间里进行,最后再用VAE解码还原成真实图像的技术路线。
这套思路自2022年Stable Diffusion的前身论文提出后几乎成了行业标准。原因很直接:直接在原始像素上做扩散计算量太大了,1024×1024的图片有一百万个像素点,如果每个像素点都要参与模型的注意力计算,显存和算力根本扛不住。VAE把这个规模压缩了16倍甚至更多,相当于把计算负担削减到了原来的零头。
但压缩是要付出代价的。VAE在把图片"瘦身"的过程中,会不可避免地丢掉一些细节,比如极细的纹理、微妙的色彩过渡,这些东西经过压缩再解压之后,很难做到分毫不差。而且更麻烦的是,VAE的训练目标是"重建",也就是让压缩再解压后的图片尽量像原图;但扩散模型的训练目标是"生成",这两个目标之间存在错位。论文里提到,这种错位会导致潜空间里出现一些奇怪的分布偏移,比如纹理被磨平、颜色发生偏差,扩散模型不得不花额外力气去"纠正"这些由VAE带来的失真。
这就好比你请了一个翻译帮你和外国朋友交流。翻译水平不错,大部分意思都能传达,但总有一些微妙的语气、双关、文化梗翻不出来,甚至有时候还会因为翻译习惯引入一点点走样。你说的话和对方听到的话,中间隔着一层"翻译腔"。如果你能直接用对方的语言交流,这层损耗就不存在了,但代价是你得从头学一门新语言,前期会说得磕磕巴巴,进步也慢得多。
像素空间扩散模型,就是那个"直接用对方语言交流"的选择。它跳过VAE这一层,直接在原始RGB像素上完成去噪和生成,理论上能够摸到VAE压缩所丢失的那部分视觉信息的天花板。而且推理时也不需要额外的VAE解码步骤,直接省下一步计算,这在讲究速度的实际应用里是个实打实的优势。
那问题来了:这门"新语言",好学吗?
第一个真相:像素空间预训练,收敛速度惨不忍睹
论文做了一个非常直接的对照实验。他们用完全一样的模型架构(基于阿里的Z-Image)、一样的训练数据(超过200亿组图文对)、一样的算力预算,唯一的区别是:一个模型在潜空间里学,另一个直接在像素空间里学。
结果毫无悬念地一边倒。
在GenEval和DPG这两个衡量图文对齐质量的评测基准上,潜空间模型从训练一开始就遥遥领先,尤其是在训练初期这个差距特别明显。
具体来看训练曲线,潜空间模型在很早期就能画出基本靠谱的物体结构和图文对应关系,而像素空间模型在同样的训练步数下,画面还是一团模糊。论文里给了个具体例子,同样是训练到5万步,让模型画"一张长椅的照片",潜空间模型已经能画出结构清晰的长椅,像素空间模型的输出还是散乱的色块。即便训练到15万步,像素空间模型仍然没有追上。
为什么会这样?
论文给出的解释是,VAE不只是一个压缩器,它其实是一种经过大规模数据训练学出来的、结构化的视觉表示方式。它把杂乱的像素信息整理成了一个更规整、更贴近语义的空间,滤掉了大量局部冗余和高频噪声,只保留和图像内容、外观相关的核心信息。
这相当于VAE已经帮扩散模型把学习任务"降了维度"。潜空间模型只需要在这个已经被清理干净的空间里学会去噪,而像素空间模型得直接面对未经处理的原始信号,一边要学全局的图像结构,一边要学局部的纹理统计规律,一边还要学怎么去噪,三件事情揉在一起,学习负担陡然加重。
打个比方,这就像两个学生准备同一场考试。潜空间模型拿到的是老师精心整理过的重点笔记,知识点已经被提炼归纳好了;像素空间模型拿到的是几百页原始教材,什么是重点、什么是废话,全靠自己一点点摸索。就算给两人同样多的复习时间,笔记党的效率显然更高。就算像素空间模型最终能学明白,那也得花更久,而在这篇论文的实验设置里,即使砸进去200亿组数据,它依然没能追平差距。
这个发现直接推翻了一种可能存在的直觉:既然像素空间避免了VAE的信息损失,是不是从头训练一个像素空间模型天然更有优势?答案是否定的,至少在预训练阶段,潜空间的"降维预处理"带来的优化便利性,远远盖过了它损失的那点信息。
转折点:与其死磕到底,不如换个跑道
既然像素空间预训练这么吃力,论文没有选择硬刚,而是提出了一个更聪明的思路:潜空间用来打基础,像素空间用来做精修。
这个思路听起来简单,业内也不是第一次有人这么想(论文提到了此前的L2P等相关工作),但真正把这条转换路径的每一个环节都仔细测过、找出最优解的,这篇论文算是做得比较彻底的一个。
具体来说,团队先在潜空间里把模型的基本能力练扎实,学会理解文本、构建物体结构、掌握基本的图像语义,然后再想办法把这个已经"身经百战"的模型,迁移到像素空间去继续训练,让它最终能直接输出RGB像素。
这个转换过程里,藏着好几个魔鬼细节。
**权重初始化:带着记忆重新出发,还是清空重来?**
第一个问题是,当模型要从潜空间切换到像素空间时,之前学到的那些知识和参数,要不要继续沿用?
论文做了对比:一个像素空间模型直接从潜空间训练好的权重继续训练,另一个则完全从零开始训练,其他条件保持一致。
结果非常清楚,用潜空间权重初始化的模型,在GenEval和DPG评分上全程领先,而且这个领先优势贯穿整个训练过程。从零开始训练的那个模型,进步速度很慢,长时间内都远远落后。
论文里给了一个具体的定性对比案例,用同一句复杂的中文提示词(描述一个雨夜孤独走在街上的女子),带潜空间权重初始化的模型在训练5000步的时候就已经能画出识别度很高的画面结构了,而从零训练的模型直到5万步,画面还是不稳定、结构混乱。
这个现象其实不难理解。潜空间训练阶段学到的,不只是"怎么在潜空间里画画"这么表面的技能,更深层的是关于物体结构、构图逻辑、文字和图像如何对应的通用知识。这些知识很大程度上是跟具体的输出空间无关的,换句话说,模型学会的是"怎么理解一句话该画成什么样",而不是"潜空间的像素该怎么摆"。这种通用知识是可以迁移的。
这就好比一个已经在小提琴上练了十年基本功的音乐家,突然要转学大提琴。虽然乐器变了,弓法、指法的具体手感都得重新适应,但他对乐理、节奏、音乐表达的理解是现成的,不需要从零学起。如果非要找一个从没碰过任何乐器的人从头学大提琴,进度自然要慢得多。如果论文里没做这个权重迁移,直接让像素空间模型从零练起,那前面辛辛苦苦攒下的潜空间预训练成果就完全浪费了,等于是白白多花一遍力气。
**训练数据的配方:自产自销,还是引入外部食材?**
第二个要解决的问题是,用什么数据来喂这个正在转型的模型。
直觉上,既然像素空间的优势就是能直接从真实高质量图片里学习细节,那是不是应该多用真实图片训练?
论文的实验结果给出了一个有点反直觉的答案:只用真实图片训练,收敛速度反而是最慢的那个选项。
真正收敛得快的,是用潜空间源模型自己生成的图片来训练像素空间模型。团队的解释是,这些自己生成的样本和潜空间模型原本学到的条件分布高度贴合,相当于给转型过程搭了一座"低落差"的桥,模型不需要一边适应新的输出格式,一边还要应付陌生的数据分布,两件事解耦开了,转型自然更顺畅。
论文还做了一个对照,用另一个完全不同的模型(FLUX2-klein-9B)生成的数据来训练,效果明显不如用源模型自己生成的数据,这进一步说明了数据分布和源模型的匹配程度,直接决定了迁移的顺滑程度。
自监督数据(Self-generated data):由训练初始化所用的那个源模型自己采样生成的图片,因为分布和源模型高度一致,用来做后续训练时能大幅降低"水土不服"的风险。
但自产数据也不是万能的,它天生带着源模型和VAE解码过程里遗留下来的错误。论文举了个具体例子,比如画面里的排版文字(typography)如果只用自产数据训练,那些扭曲变形的文字错误会被继续沿用下去,怎么都改不掉。
于是团队的最终方案是把自产数据和高质量真实图片按1:1混合。自产数据负责让转型过程又快又稳,真实图片则负责把VAE压缩过程中丢掉的那些细节信息找补回来,同时纠正源模型遗留的各种错误。
这其实特别像做菜时候的"提鲜"和"补充营养"两件事分开做。你可以先用现成的高汤(自产数据)打底,保证味道框架稳定不跑偏,再往里加新鲜的食材(真实图片)来补足营养和口感层次。如果只用高汤,汤底虽然稳,但缺少新鲜食材带来的那些细腻口感;如果只用生食材从头炖,火候和味道很难把控,耗时也长。两者结合,才是效率和品质都兼顾的做法。
**预测目标之争:预测噪声速度,还是直接预测干净图像?**
扩散模型在训练时,本质上是让神经网络去预测"从当前带噪图像到目标之间差了什么",这个"差了什么"可以有不同的数学表达方式。论文里提到两种主流选择:
x-prediction:模型直接预测出干净、无噪声的目标图像本身。
v-prediction:模型预测的是沿着扩散路径运动的"速度",这是目前主流潜空间模型(包括Z-Image本身)常用的做法。
之前有研究(论文提到的JiT)认为,在像素空间训练里,x-prediction是保证训练稳定的关键,而v-prediction可能会导致训练发散、崩掉。
但这篇论文的实验场景有点特殊,因为它的像素空间模型是从一个用v-prediction训练出来的潜空间模型初始化而来的。这就带来一个新问题:迁移过程中,到底要不要把预测目标也跟着换掉?
实验结果显示,因为有了潜空间权重打底,两种预测方式都能稳定训练,不会出现从零训练时那种发散问题。但即便如此,切换到x-prediction的模型,在各项评测指标上依然稳定优于继续用v-prediction的模型。
这说明了两件事:潜空间的初始化确实能兜住训练稳定性这个底线,但要拿到最好的最终效果,还是得让预测目标匹配上像素空间本身的特性。
**解码器架构的选择:多花参数量买画质,值不值?**
模型内部处理完信息之后,总得有一个模块把这些抽象的特征,转换成具体的每个像素点的颜色数值,这个模块叫做解码头。
论文对比了五种方案:JiT的线性投影头(结构最简单)、DiP的轻量级卷积U-Net、PixelDiT的Transformer解码头(简称PiT)、Deco的频率解耦头,以及作为参照的传统VAE。
结果呈现出一个很清晰的效率和质量的权衡关系。
| 解码器 | 参数量(M) | 延迟(ms) | GenEval | DPG |
|---|---|---|---|---|
| JiT | 2.95 | 0.07 | 0.7380 | 86.19 |
| DiP | 10.09 | 6.02 | 0.7545 | **87.54** |
| PiT | 2249.82 | 74.96 | **0.7697** | 86.36 |
| Deco | 315.92 | 5.01 | 0.7347 | 86.10 |
PiT这个方案,画质评分(GenEval)确实是最高的,但代价极其惊人,它的解码器单独就有22.5亿参数,相当于整个66亿参数主干网络的37.5%,计算量高达19731 GFLOPs。这就像为了让门锁开得更顺滑一点,专门给你的公寓装了一个和主体建筑差不多重的门把手,性价比完全说不过去。
JiT这个方案效率是最高的,延迟只有0.07毫秒,但代价是画面质量打了折扣,而且会在图像分块的边界处出现明显的网格状瑕疵,就像拼图没拼严实,能看到接缝。
DiP最终胜出,靠的是恰到好处的平衡:只用1009万参数,DPG评分反而是所有方案里最高的,GenEval也具有竞争力,而且它生成的图像在分块边界处过渡更平滑。论文解释说,这得益于卷积网络天生的"局部空间归纳偏置",卷积操作本身具有局部性和权重共享的特性,能让相邻的图像块特征在最终生成像素之前先互相"打个招呼",从而减少块与块之间的生硬拼接感,而且不需要像PiT那样堆叠巨大的参数量。
**噪声调度的隐藏陷阱:理论算出来的最优解,居然不是真的最优**
这是整篇论文里我觉得最有意思的一个细节,因为它展示了一次"理论推导很漂亮,但现实打脸"的过程。
从潜空间转到像素空间,图像的空间分辨率变了(潜空间通常是原图的1/8大小),信号的数值分布也变了。这意味着原本给潜空间设计的噪声调度方案,直接搬到像素空间用,很可能会让模型面对一个完全不匹配的信噪比环境。
信噪比(Signal-to-Noise Ratio,简称SNR):衡量在扩散过程某个时间步,图像里"有效信号"相对于"噪声"的强弱程度,是扩散模型设计中非常核心的一个概念。
团队没有选择重新设计整套噪声调度,而是引入了一个简单的缩放因子γ,用来调整噪声的强度。他们先做了一个理论推导:假设像素空间和潜空间的唯一区别就是空间分辨率(潜空间的空间尺寸是像素空间的1/8),那么通过匹配两者的信噪比,可以推算出γ的理论最优值应该是8。
但实际测试γ取1、2、4、8这四个值后发现,效果最好的居然是γ=2,理论算出来的8反而是效果最差的几个之一。
| γ值 | GenEval | DPG |
|---|---|---|
| 1 | 0.6811 | 84.03 |
| **2** | **0.7545** | **87.54** |
| 4 | 0.7413 | 86.01 |
| 8 | 0.7316 | 85.64 |
定性观察也印证了这一点,γ取1、4、8的时候,生成的图片都会出现明显的色彩偏移,只有γ=2的时候色彩渲染最平衡自然。
这说明什么?说明"分辨率差异"这个单一因素,根本没法完整解释潜空间和像素空间之间真正的分布差异。VAE编码器不等同于简单的平均池化操作,RGB像素和VAE潜在表示在信号统计特性、预测目标上还有很多没被这套简化理论捕捉到的差异。
这个发现其实挺有启发性的。很多时候我们会本能地信任一个"看起来很严谨"的数学推导,觉得算出来的答案肯定错不了。但复杂系统里往往藏着理论模型没有覆盖到的变量,这时候老老实实做实验去试,比迷信公式更靠谱。这就像你按照营养学公式精确计算出了一份"理论最优"的减脂餐单,结果真人试吃下来,身体的实际反应和公式预测的完全对不上号,因为人体的复杂程度,从来不是一套简化公式能完全装下的。
效率的进一步压榨:把图像切得更粗,把采样步数砍得更狠
搞定了训练阶段的各种细节之后,论文还琢磨了怎么让最终的模型跑得更快。这里用了两招。
**第一招:渐进式扩大图像分块尺寸**
Patch Size(图像分块尺寸):扩散模型处理图像时,通常不是逐像素处理,而是把图像切成一个个小方块(patch),每个小方块被打包成一个"视觉词元"(token)送进模型。分块尺寸越大,同样大小的图片被切出来的词元数量就越少,模型需要处理的序列就越短,速度就越快,但每个词元需要承载的信息量也越大,容易丢细节。
论文原本的设置用的是ps16(每个块16×16像素),对应1024×1024图片会被切成64×64的网格。如果想提速,很自然的想法是加大这个块的尺寸,比如换成ps32,块数直接减少4倍。
但直接从头训练一个ps32的像素空间模型,效果很差,会出现明显的局部瑕疵。原因也不难理解,因为这样做同时改变了两件事,一是从潜空间换成像素空间的预测目标,二是把词元的空间粒度一下子变粗了。两个变化叠在一起,模型的局部视觉先验知识很难顺利迁移过去,每个词元要覆盖的空间范围变大了,学习难度陡增。
论文的解决办法是分两步走:先把模型从潜空间迁移到像素空间,同时保持ps16这个精细粒度不变,等这一步稳定收敛了,再把它进一步适配到ps32,这个方案被称为ps32-adapt16。
结果是,ps32-adapt16的收敛速度比直接训练ps32快得多,最终效果和ps16基本持平,而且用的词元数量只有ps16的四分之一。
但如果再进一步,从ps32-adapt16继续扩展到ps64呢?论文也试了,虽然又能再省4倍的词元,但这次细节明显开始劣化,评测分数也跟着下滑。这说明这条路是有边界的,压缩到一定程度后,画面细节的损失就藏不住了。
这整个过程其实特别像学游泳换泳姿。你已经练熟了自由泳的基本动作,突然让你直接改成难度更高的蝶泳,还要求速度更快,大概率会手忙脚乱,姿势变形。更靠谱的做法是先在原来熟悉的自由泳节奏里,把新学到的呼吸方式练稳,再逐步过渡到蝶泳的动作幅度。如果没有这个循序渐进的过渡,直接一步到位地跳到最省力的姿势,反而更容易呛水。如果论文没有做这个渐进适配,直接训练更大分块尺寸的模型,画面质量的损失是要吃更大亏的。
**第二招:步数蒸馏,把100步压缩到4步**
第二个提速手段是步数蒸馏。
步数蒸馏(Step Distillation):让一个原本需要几十上百步迭代去噪才能生成图像的扩散模型,学会用极少的几步甚至一步就完成生成,同时尽量不损失画质的技术。
在潜空间模型里,步数蒸馏虽然管用,但有一个隐藏的成本瓶颈:当去噪步数被压缩到极致(比如只剩4步)之后,原本可以忽略不计的VAE解码那一步,占总耗时的比例就变得越来越大了。这就好比你把做菜的步骤从10步压缩到2步,结果发现最后摆盘装饰这一步原本占用时间很少,现在却成了整个流程里最耗时的部分。
像素空间生成天然没有这个包袱,因为它本来就直接输出RGB像素,没有额外的解码步骤。论文应用了两种蒸馏技术(Decoupled-DMD和DMDR)对像素空间模型进行加速。
最终效果相当亮眼。仅仅是把预测空间从潜空间换成像素空间,就能带来1.10倍的提速;加上渐进式分块适配后,单张图片的延迟降到4.56秒,相当于4.41倍加速;再叠加步数蒸馏之后,像素空间模型生成一张图只需要0.20秒,而同等条件下的潜空间蒸馏模型需要0.95秒,加速比达到4.75倍。把所有技巧叠加在一起,相比最初那个原始的潜空间流程,总体加速比高达100.6倍。
最终成绩单:又快又好,不是自我感动
理论和局部实验说了这么多,最终还是要看整体表现能不能立得住。
论文在Z-Image和FLUX2-klein两个模型家族上都验证了这套方案。
在100次函数评估(NFE,可以理解为去噪迭代的次数)的设置下,Z-Image的像素空间版本相比原始潜空间版本,推理延迟从20.12秒降到4.56秒,加速4.41倍,同时GenEval评分从0.7510提升到0.7644,DPG评分从86.91提升到87.60,几乎是又快又好。
对比此前同类工作L2P,新方案在四个评测基准上全面胜出,延迟还更低。而在4次函数评估(也就是极限压缩到几乎"一步出图")的场景下,加速比达到4.75倍,画质评分同样反超原版。
| 模型 | NFE | 延迟(秒) | GenEval | DPG |
|---|---|---|---|---|
| Z-Image(潜空间) | 100 | 20.12 | 0.7510 | 86.91 |
| L2P(像素空间) | 100 | 18.26 | 0.7612 | 86.00 |
| Ours(像素空间) | 100 | **4.56** | **0.7644** | **87.60** |
| Z-Image-Turbo(潜空间) | 4 | 0.95 | 0.7625 | 85.31 |
| Ours-Turbo(像素空间) | 4 | **0.20** | **0.7698** | **86.85** |
更关键的是,这套方法在换到另一个完全不同的模型家族FLUX2-klein上依然管用,同样取得了3.18到3.29倍的加速,同时大部分评测指标优于原版和此前的对比方案AsymFlow。这说明这套"潜空间打底、像素空间精修"的配方,不是针对某一个模型量身定做的偏方,而是有一定普适性的方法论。
写在后面
读完这篇论文,最让我意外的地方其实是γ=2那个实验。一个推导得挺严谨的理论公式,算出来的最优解是8,结果实测下来2才是最好的,而且差距不小。这提醒我一件事:在复杂系统里,理论模型往往只捕捉到了几个主要变量,剩下那些没被建模进去的因素,很可能才是决定成败的关键。这种"算得漂亮但测不出来"的落差,在很多工程领域可能都反复出现,只是很少有论文愿意老老实实把这个过程写出来。
另一个值得琢磨的地方是,论文里反复出现的"自产数据"策略,用源模型自己生成的图片去训练它的下一代版本。这种自己喂自己的做法乍一看有点像近亲繁殖,容易把自身的缺陷也一起遗传下去(论文里提到的文字排版错误就是证据)。但它同时又是让训练变快最有效的手段。这种"效率和纯净度互相拉扯"的局面,感觉在很多自我迭代的系统里都会遇到,AI训练AI,或许迟早得面对这个问题。
论文里也留了一个没解决的坑:ps64-adapt32这个更激进的压缩方案为什么会掉分,具体是哪个环节丢了细节,论文没有深挖。如果未来能找到办法让词元压缩得更狠还不掉画质,那这套像素空间路线的天花板可能还能再往上顶一顶。
Q&A
Q1:像素空间扩散模型和潜空间扩散模型的核心区别是什么?
A:潜空间扩散模型先用VAE把图片压缩成低维表示,在压缩空间里训练和生成,最后再解码还原成图片;像素空间扩散模型直接在原始RGB像素上训练和生成,不需要VAE压缩和解码这道工序,能保留VAE压缩过程中可能丢失的细节,推理时也少一步解码,速度更快。
Q2:为什么不直接从零开始训练像素空间模型,而要先在潜空间训练?
A:论文实验发现,在完全相同的算力和数据条件下,直接从零训练像素空间模型收敛速度明显慢于潜空间模型,而且训练很久也追不上潜空间模型的效果。所以更好的做法是先在潜空间高效地训练出模型的基础能力,再把这个模型迁移转换到像素空间继续训练,这样既能借到潜空间训练快的优势,又能拿到像素空间画质和速度上的好处。
Q3:这套潜空间转像素空间的方法能带来多大的速度提升?
A:在Z-Image模型上,100步采样场景下能实现4.41倍加速,4步快速采样场景下能实现4.75倍加速,叠加分块尺寸优化和步数蒸馏后总加速比达到100.6倍;在FLUX2-klein模型上也能实现3.18到3.29倍加速,同时生成质量基本持平或优于原始潜空间模型。
好文章,需要你的鼓励
这篇论文提出一种插件式2D动作接口,让已训练好的3D运动语言模型无需修改或微调即可直接理解2D姿态输入。实验证明2D输入效果媲美3D输入,且在真实视频场景下配合专门的降噪适配器,2D方案比3D姿态估计更省算力、更实用,为动作理解模型的现实部署提供了新路径。
研究团队让8种AI智能体独立完成100项真实科研任务,深度剖析800份研究轨迹后发现,即便是最强模型,也普遍存在"发现问题却不修正"的现象,背后根源指向AI缺乏检验自身产出、主动纠错的元认知能力。
WorldRover是一套面向可探索世界建模的合成视频数据引擎,基于虚幻引擎构建,能让同一段探索轨迹在保持路线与场景一致的前提下,重新渲染为多种视角和外观状态,并同步提供深度、光流、长程点追踪等丰富标注,最终发布WorldRover-10M数据集,含2190万帧、202.7小时视频。
这篇论文指出,现有多目标强化学习训练大模型时存在"一刀切"分配优化精力的问题,提出SA-MRPO方法,根据每个奖励目标的饱和程度动态调整其权重,在数学推理、自适应推理、代码生成等任务上均取得优于现有方法GDPO的效果。