
你有没有想过一件事:为什么让一群专家平均分摊工作,有时候反而会把事情搞砸?
这听起来有点反直觉。我们从小被教育要"公平分配任务",团队协作讲究"人人有份"。但在最新的视频生成模型研究里,字节跳动的研究团队发现了一个扎心的事实:强迫模型内部的"专家们"平均干活,恰恰是限制视频生成质量的元凶之一。这篇发表于NeurIPS 2026、题为《SplitMoE》的论文,揭开了一个此前被整个行业忽视的问题。
**先搞懂问题出在哪**
要理解这个问题,得先说说什么是混合专家模型。
MoE(Mixture-of-Experts,混合专家模型):一种神经网络设计思路,不用一个超大的网络处理所有数据,而是准备很多个"专家"网络,每次只挑选其中一小部分来处理当前的输入,这样能在不增加计算量的情况下大幅扩充模型容量。
这个思路最早在语言模型里大放异彩。GPT这类大语言模型靠着MoE架构,能做到"参数总量很大,但每次实际计算用到的参数很少",既聪明又省电。于是研究者们理所当然地想:既然MoE在语言模型上这么好用,直接搬到视频生成模型上应该也行吧?
问题就出在这个"理所当然"上。
语言和图像视频,本质上是两种完全不同的数据。语言是离散的,一个词就是一个词,边界清清楚楚,"苹果"和"手机"天然就是两个不搭界的语义单元,专家之间天然容易划分势力范围。但视频不是这样。视频里的像素点(经过编码后的"token")是连续的、高度冗余的,同一个物体的相邻区域往往长得几乎一样,背景更是大片雷同。
论文里做了个很直观的实验:把语言token和视觉token的自相似度画出来对比。语言token的相似度矩阵看起来杂乱、稀疏,而视觉token的相似度矩阵却呈现出大片大片的高相关区域。这说明视觉信息天生就是"粘"在一起的,而语言信息天生就是"散"开的。
用一个具体场景来理解这个差异:如果你负责给一篇文章的每个词分类打标签,不同词汇天然指向不同类别,"跑步""吃饭""睡觉"分给不同的标注员完全没问题,标注员之间不会打架。但如果换成给一张照片里的每一个像素块打标签,一匹马的躯干上相邻的十个色块几乎长得一模一样,你非要把它们随机拆给十个不同的标注员处理,那这匹马的身体在最终拼接出来的结果里必然是支离破碎的,腿可能长歧义,毛色可能突然跳变。这就是为什么把语言模型的均匀分配逻辑直接搬到视觉领域会出问题:强迫均匀,恰恰破坏了视觉数据内在的连贯性。
论文把这个现象命名为"均匀性陷阱"(uniformity trap)。标准MoE架构里有个叫"负载均衡"的机制,专门通过一个辅助损失函数,强迫所有token在各个专家之间平均分布,防止某几个专家被闲置、某几个专家被过度使用。这套机制在语言模型里效果拔群,但放到视频上,它逼着本该聚在一起的相邻像素块,被硬生生拆散到不同专家手里处理,造成了论文里说的"时空碎片化"。
研究团队用一组量化指标验证了这个猜测。他们拿现成的语义分割模型,把视频画面按人物、物体、背景分成不同的语义区域,然后观察标准MoE把这些区域的token分给了哪些专家。结果发现两个指标都表现得很糟糕:同一语义区域内部的token经常被打散到不同专家(路由一致性低),不同语义类别之间也没能被分给有区分度的专家组(语义区分度低)。换句话说,标准MoE的路由既不"认人",也不"聚类",完全是一锅乱炖。
**拆开专家池:语义专家和通用专家各管一段**
面对这个问题,研究团队给出的答案是SplitMoE,核心思路是把原本一锅炖的专家池,直接一分为二。
具体来说,论文把专家分成两组:语义专家(Semantic Experts)和通用专家(Generic Experts)。语义专家负责捕捉画面里高层次的语义结构,比如"这是一匹马""这是一个人在跑步";通用专家则专注于处理局部的视觉细节和残差信息,比如毛发的纹理、光影的变化。
论文里用了一个很贴切的比喻:这就像画家画画时先打草稿再上色。语义专家扮演的是"打草稿"的角色,先把画面的结构轮廓定下来;通用专家扮演"上色渲染"的角色,负责把细节填满。
如果不这样拆分会怎样呢?论文里做的对照实验(Wan2.2-MoE,也就是标准MoE版本)已经给出了答案:同样的专家数量、同样的训练数据,只是没有按语义和通用两条线分开处理,结果在人类保真度(Human Fidelity)和物理合理性(Physics)这些语义敏感的指标上明显吃亏,西瓜切开后瓜瓤的完整语义都保不住。这说明单纯把专家池切成两半、给两条独立路由通道,如果没有明确的语义引导,增益其实很有限,真正起作用的是接下来要讲的"原型引导"机制。
这里有个技术细节值得展开。传统MoE用的是softmax,让所有专家互相竞争,谁分数高谁就被选中,这意味着专家之间是"你死我活"的关系。SplitMoE换成了独立的sigmoid打分:
sigmoid:一种把任意数值压缩到0到1之间的函数,常用来表示"匹配概率",与softmax不同的是,sigmoid给出的多个分数之间不需要总和为1,也就不存在强制的相互竞争关系。
这个改动的意义在于,一个token完全可以同时被判定为"高度适合某个语义专家"又"高度适合某个通用专家",两者互不排斥。这就好比公司里一个员工可以同时是项目负责人又是执行者,不需要在两个身份里二选一。为了保证计算量不超支,论文规定语义专家最多选2个、通用专家最多选6个,总数8个,和原来标准MoE的Top-8路由预算完全对齐,这样后面比较性能提升的时候,才能确定这不是靠"偷偷多用计算量"换来的。
**用原型当"翻译官",把VAE特征的语义信息传给路由器**
光是分开两组专家还不够,SplitMoE还引入了一套叫"原型引导语义路由"(Prototype-Guided Semantic Routing)的机制,这是整篇论文技术含量最高的部分。
VAE(Variational Autoencoder,变分自编码器):视频生成模型里常用的一种压缩技术,把原始的视频像素压缩成更紧凑的特征表示,再从这个压缩表示里还原出画面,这个压缩后的特征空间通常保留了丰富的视觉语义信息。
论文的思路是:干净的VAE特征本身就自带了丰富的视觉语义结构(比如相似物体的特征天然聚在一起),这是一个现成的、不需要额外花钱训练的语义参照系。于是团队设计了一组可学习的"原型"(prototype),把它们当作VAE特征空间里的语义锚点,每个原型对应一个语义专家。
具体的训练分成两条线。第一条叫"路由对齐损失"(Lalign),做法是拿干净的VAE特征去跟这些原型比对相似度,算出一个"标准答案"式的软目标分布,然后让路由器(接收的是DiT里带噪声的视觉token)去逼近这个软目标,用KL散度来衡量两者的差距。
KL散度(Kullback-Leibler Divergence):衡量两个概率分布之间差异程度的一种数学工具,数值越小说明两个分布越相似。
第二条线叫"原型优化损失"(Lproto),目的是让这些原型本身保持健康的分布状态,不要都挤在一起,也不要飘得太远。这里用了一个"拉扯"(pull)加"排斥"(push)的双力机制:拉力让原型贴近当前批次以及历史积累的视觉特征(避免原型变成"死原型",脱离实际数据分布);推力则让不同原型之间保持一定的间隔(避免多个原型都跑去描述背景这种大片重复出现的内容,造成专家冗余)。
这套机制像什么?想象一个班级里选课代表,如果只靠拉力(让课代表贴近学生实际情况),所有课代表可能都被最活跃、声音最大的那几个学生"拉"过去,变成清一色只代表某一类学生诉求;但如果只靠推力(强制课代表们互相拉开距离),课代表可能会被推到完全没有学生支持的边缘立场,变得毫无代表性。论文的消融实验也验证了这一点:只用拉力不用推力,或者反过来,效果都不如两者同时用,拉力保证原型贴合真实的视觉语义,推力保证它们覆盖到足够多样的语义类别,两者缺一不可。
论文还专门做了个可视化实验,把原型投射到一个二维球面空间里观察分布情况。只用拉力的时候,原型明显都堆在少数几个"热门"区域;只用推力的时候,一些原型被推到了远离任何真实数据的空白区域,变成了没人认领的"僵尸专家";只有两者结合,才能形成分布均匀又贴合数据的健康布局。
**意外发现:模型自己学出了"先构图再上色"的时间节奏**
这篇论文最让人意外的地方,不在于方法设计本身,而在于一个完全没被刻意设计出来、却自然涌现的现象。
扩散模型生成图像或视频的过程,是从一片随机噪声开始,通过多轮"去噪"逐步还原出清晰画面的。论文追踪了SplitMoE在50步去噪过程中,语义专家被分配到的路由权重变化情况,发现了一个清晰的曲线:去噪初期(大概第10到15步,画面还是一片高噪声的模糊状态),语义专家的权重明显更高;随着去噪推进,画面细节越来越清晰,语义专家的权重逐渐降低,更多计算权重转移给了通用专家。
这个发现之所以让人意外,是因为整个训练过程里,团队没有加任何显式的规则去强制这个时间节奏,没有告诉模型"前期多用语义专家,后期多用通用专家"。这个分工完全是模型自己在训练中摸索出来的。
这背后的道理其实和人画画的顺序对得上:一片空白画布上,你不可能一上来就抠细节,得先把整体轮廓和构图定下来(这时候需要的是全局性的、结构性的判断,对应语义专家的角色),等骨架稳了,才轮到细致的光影和纹理(这时候需要的是局部的、生成性的灵活操作,对应通用专家的角色)。如果一开始就让通用专家介入太多,细节画得再精致,骨架歪了整张画也救不回来;如果结尾阶段还依赖语义专家死磕整体结构,画面反而会缺乏细节的丰富度。
论文管这个现象叫"涌现式时间专精"(Emergent Temporal Specialization)。这个结果之所以重要,是因为它从侧面证明了语义专家和通用专家的划分不是研究者拍脑袋想出来的人为区隔,而是切中了视频生成过程本身内在的一个规律,模型学会了怎么用这个架构去匹配"先构图后填色"的生成逻辑。
**实验结果:数字说话**
理论说得再漂亮,最后还是得看跑分。研究团队基于Wan 2.2这个开源视频生成模型的低噪声检查点做改造,把其中第15到35层里的偶数层的密集前馈网络替换成MoE层,每层配置100个专家(20个语义专家加80个通用专家),每个token激活8个专家(2个语义加6个通用)。整体模型的总参数量27B(十亿),但每次实际计算激活的参数只有14B,和原来的密集模型保持同样的计算量。
在VBench-2这个评测体系(涵盖创造力、常识性、可控性、人类保真度、物理合理性五大维度)和T2V-CompBench(考察组合式生成能力)上,SplitMoE和几个对照组做了系统比较。
对比密集微调基线(Dense Wan2.2-FT),SplitMoE在全部评测维度上都胜出,而且训练收敛速度明显更快,论文里的loss曲线显示,SplitMoE只需要大约70%的训练步数就能达到密集模型的同等损失水平。
对比标准MoE基线(Wan2.2-MoE,也就是没有语义分支、单纯把专家池扩大的版本),两者总体表现相近,但在Human Fidelity(人类保真度)和物理合理性这类对语义结构敏感的指标上,SplitMoE有明显优势,这也验证了前面说的"单纯拆分专家池收益有限,原型引导才是关键"。
和市面上一批公开的视频生成模型(CogVideoX-1.5、Mochi、HunyuanVideo、LongCat-Video、LTX-2、Wan2.2、OmniWeaving)相比,SplitMoE在Creativity(58.46%)和Human Fidelity(84.47%)两项上拿到了最高分,在T2V-CompBench的Consistent Attribute维度也拿到最高分(84.63%)。需要说明的是,这些独立开发的模型在训练数据规模、算力预算上各不相同,直接横向比较存在一定局限,论文也坦诚地指出这一点,并把重点放在了同源受控消融实验上来验证架构本身的贡献。
速度方面,团队也给出了实测数据:SplitMoE的训练速度是每步6.84秒,标准MoE是6.69秒,密集模型是5.66秒。也就是说,引入这套复杂的语义路由机制,带来的额外开销很小,并没有让模型变得笨重难用。
论文里还有一组可视化实验特别直观,把某一帧视频画面里每个token被分配到的专家用不同颜色标出来,对比标准MoE和SplitMoE的路由模式。标准MoE的着色图看起来像被打散的马赛克,同一匹马的身体轮廓被切成好几种颜色,明显能看出"时间抖动"(相邻帧里同一区域跳到了不同专家)、"空间条纹"(本该连续的区域被人为切开凑均衡)、"语义碎片化"(同一物体上相邻的token散落到毫不相关的专家)三种典型病症。而SplitMoE的着色图里,马和谷仓这些完整物体呈现出连贯一致的色块,背景纹理则交给通用专家去处理,整体上看起来更"整齐"。
写在后面
读完这篇论文,最让我意外的一点是,它挑战的不是某个具体的算法细节,而是一个我们习以为常、从没怀疑过的设计假设。均匀分配这件事,在管理学、资源调度、甚至日常生活里,大多数时候都被视为"公平"和"合理"的代名词。这篇论文提醒我们,均匀不等于合理,均匀只是一种特定数据结构下的最优解,换一种数据结构,均匀可能恰恰是伤害。
论文里那个"涌现式时间专精"的发现,让我联想到人类学习知识的过程。我们学一门新学科的时候,往往也是先建立整体框架,再往框架里填充细节。这个"先构图后填色"的逻辑,不只是画家的经验,可能是所有复杂系统处理信息的通用规律,视频生成模型只是恰好用一种可观测、可量化的方式,把这个规律给"演"出来了。
论文最后坦承了两个局限:一是依赖冻结的VAE特征作为教师信号,如果VAE本身的语义表达能力有短板,整个原型引导的效果也会受限;二是稀疏路由本身带来的工程开销,虽然论文里显示开销很小,但在更大规模的部署场景下,这个开销会不会被放大,还是个开放问题。
如果均匀分配在视频领域是个陷阱,那在语音、3D点云、甚至多模态融合这些同样具有强空间相关性的数据类型上,会不会藏着同样的陷阱?这个问题,恐怕才刚刚开始被问出来。
Q&A
Q1:SplitMoE解决的核心问题是什么?
A:SplitMoE要解决的是标准混合专家模型在视频生成上的"均匀性陷阱"问题,标准MoE强制token均匀分配给各专家,但视频token本身高度相关连贯,均匀分配会把同一物体的相邻区域拆散到不同专家,造成时空碎片化和结构失真。
Q2:SplitMoE和标准MoE最大的区别是什么?
A:SplitMoE把专家池拆成语义专家和通用专家两组,语义专家负责捕捉画面的高层结构,通用专家负责处理局部细节和残差,并配合原型引导路由机制,让语义相近的token自然聚类,而不是被强制均匀打散。
Q3:SplitMoE的实验效果如何?
A:在VBench-2和T2V-CompBench评测中,SplitMoE在相同激活参数预算下超过标准MoE和密集微调基线,在创造力和人类保真度指标上拿到最高分,同时训练收敛速度更快,额外计算开销很小。
好文章,需要你的鼓励
本文介绍LT-OPD训练框架,通过让极限压缩的多模态大模型在自己生成的内容上接受满血版模型指导,并配合渐进式课程学习,在仅保留5%视觉token时把性能保留率从68.6%提升到82.3%,且不增加推理成本。
本文解读ALIGNOPSD方法,该方法针对AI智能体训练中"决策与时间戳错配"问题,通过先对齐功能相同的决策场景再打分,并按可变长度决策段分配信用,在ALFWorld、WebShop、Search-QA三大任务上相比GRPO提升5.5%至8.7%。
本文介绍自适应一致性图(ACG)方法,通过持久化执行记忆图与预算感知的上下文构建,帮助AI智能体在长任务中减少信息失联,在多项基准测试中相比ReAct等基线方法提升了任务成功率。
多智能体AI协作时重复计算KV缓存浪费严重。PReCache提出预计算低秩缓存和中性基础缓存重构两项设计,免训练实现最高3.1倍加速、2.3倍吞吐提升,且准确率仅比不共享方案低1.1个百分点。