跳到主要内容
返回时间线
arXiv来源发表:

SplitMoE把视频扩散模型的专家池拆成语义与通用两路,在14B激活参数下超过同源MoE并呈现由粗到细的去噪路由

核心概要

该工作指出语言模型式的token级MoE在视频扩散中会陷入“均匀性陷阱”——语义组织不足叠加均匀专家使用正则,使同一物体的相邻patch被分散到不同专家,造成路由碎片化与结构失真;为此提出SplitMoE,把专家池拆为语义专家与通用专家,用原型引导路由和pull-push正则让token按语义属性自然聚类,在激活参数预算相同时于VBench-2.0与T2V-CompBench上优于传统负载均衡MoE,并观察到语义专家权重在早期高噪声阶段(约第10–15步)达到峰值、随后转向通用专家的由粗到细去噪规律。

AI-generated editorial illustration: Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE

深度剖析

论文把“均匀性陷阱”作为视频MoE的核心问题提出:标准MoE在语言建模中依赖负载均衡,把token均匀分散到专家池,而视频token在时空上高度冗余、语义长尾,导致同一语义区域的token被拆散。 此前视觉生成中的MoE多沿用语言中心设计,或只按条件类型、任务模态做专家解耦(如ProMoE、MammothModa2);该工作把问题定位到视频结构本身的时空冗余与语义不平衡。 用现成语义分割掩码对视频token分组,测量语义区分度与样本内路由主导性,报告标准MoE在多数语义类别上两项指标均偏低;并给出Top-1专家图,指出时间抖动、空间条带、语义碎片三类现象。

SplitMoE把专家池显式拆成语义专家与通用专家两个不相交子集,语义专家负责高层语义抽象,通用专家保留残差视觉信息与灵活生成能力,并用独立sigmoid分数允许同一token同时匹配两类专家。 不同于单一同质专家池加全局softmax竞争,这种分角色划分让语义分支与通用分支各自承担不同功能,避免把低频语义与高频细节强行放在同一池中联合优化。 在Wan 2.2低噪声checkpoint上把第15至35层偶数层FFN替换为稀疏MoE层,每层含1个共享专家与100个路由专家(20语义、80通用),Top-k激活后每次前向激活27B中的14B参数,与稠密基线保持计算量对等。

原型引导语义路由用可学习原型在VAE特征空间与DiT token之间搭桥:路由器对齐目标由干净VAE特征与原型余弦相似度给出,原型本身由pull(拉向当前批次与历史特征)与push(原型间带margin排斥)两项优化。 与ProMoE直接在DiT层内做原型匹配不同,这里把原型当作DiT路由logits与重建性VAE特征之间的桥梁,且pull与push被证明是耦合机制。 消融显示去掉原型引导、只保留20/80划分的变体与标准MoE表现相近,说明仅靠专家划分收益有限;只保留pull或只保留push的变体在量化指标上不稳定,甚至可能不如无原型引导的变体,验证扩散损失也更差;VAE空间可视化显示无push时原型被主导视觉区域吸引、覆盖不足,无pull时原型远离数据流形、产生死专家。

在匹配激活参数预算下,完整SplitMoE在VBench-2.0与T2V-CompBench上优于同源稠密微调与标准MoE,并呈现由粗到细的路由时序规律。 论文强调增益来自角色感知的容量分配而非更大的计算预算,并给出无需显式时间步条件约束就自发出现的阶段依赖路由。 同源对比中Dense Wan2.2-FT为14B、Wan2.2-MoE与SplitMoE各变体为A14B;完整SplitMoE在VBench-2的Creativity 58.46%、Common Sense 64.89%、Human Fidelity 84.47%、Physics 69.41%,T2V-CompBench的Consist attr. 84.63%、Numeracy 44.01%;验证扩散损失显示约70%训练步数即达到可比损失;50步去噪轨迹中语义专家权重在约第10–15步达峰后下降。

启示与展望

该结果面向以扩散Transformer为骨干的文本到视频生成,在Wan 2.2低噪声checkpoint上通过MoE upcycling实现,适用于希望在激活参数预算不变的前提下提升生成质量与收敛速度的研究与工程团队;论文给出的路由指标、Top-1专家图与去噪轨迹分析可作为诊断视频MoE路由的参考工具,其由粗到细的时序规律也为按阶段分配专家容量提供了设计依据。

论文自述的局限包括依赖冻结视觉特征与稀疏路由带来的额外开销,并指向自适应划分、高效分布式路由与更广视频生成任务等方向;此外,跨模型比较中不同模型在训练数据、规模、算力与后训练配方上存在差异,论文因此把结论重心放在同源消融上,读者在解读与独立开发模型的横向对比时仍需留意这一范围。原型引导中pull与push必须成对使用,单独一项可能引入有偏的路由先验,这一耦合关系在迁移到新数据分布时是否稳定,仍是值得继续观察的问题。

来源