E-MoE 用专家路由当离散隐变量,把 LM1B 一步生成困惑度从 1433.8 降到 643.8
核心概要
该工作提出 E-MoE,把混合专家骨干的专家路由决策当作离散共享隐变量,使掩码扩散模型的反向过程成为因子化分布的混合,在不增加每 token 激活参数的前提下改善少步生成:在合成二维分布、二值化 MNIST 和 LM1B 上均优于因子化基线,LM1B 在 NFE=1 时生成困惑度由 MDLM 的 1433.8 降至 643.8。
深度剖析
E-MoE 把反向过程写成以离散共享隐变量为条件的因子化分布混合,该隐变量就是 MoE 骨干已经算出的逐 token、逐层专家路由决策。 此前的连续隐变量路线(如 VADD)需要额外的识别网络和固定高斯先验;E-MoE 复用同一个路由器,在噪声序列与干净序列上分别给出先验与后验,因此不新增识别模型、也不需要设计先验。 论文给出该混合反向过程的负 ELBO 上界推导,并把隐变量 KL 化为逐层逐 token 的类别 KL,由路由器自身计算;训练用 Gumbel-Softmax 直通估计器处理离散路由。
在少步生成这一因子化误差最明显的区间,E-MoE 的生成质量明显优于因子化基线与连续隐变量基线。 论文报告在 NFE=1 和 NFE=2 时,E-MoE 相对所有基线把生成困惑度降低约 50%,且样本熵保持可比(约 4.34–4.35);MAUVE 在 NFE=1 时 E-MoE 明显领先。 LM1B 上三个模型共享同一小型 DiT 骨干、相同训练预算与相同激活参数量,E-MoE 每 token 激活参数与 MDLM 相同;结果以生成困惑度、样本熵和 MAUVE 三种指标报告。
在二维合成分布与二值化 MNIST 上,E-MoE 恢复了因子化采样器丢失的跨位置结构。 因子化 MDLM 在低 NFE 下会把不同簇的坐标拼成不存在的伪模式、或把质量铺满流形周围;E-MoE 的样本集中在真实簇与螺旋流形上,并在二值化 MNIST 上取得三者中最好的测试 BPD(0.062)。 二维任务用有效性指标衡量落在数据支撑上的样本比例,E-MoE 在 8-modes 上从 NFE=1 起即高于 VADD;MNIST 上 E-MoE 参数量 2.49M,与 VADD 的 2.50M 基本持平。
消融显示少步收益来自混合本身而非参数规模:把路由改为贪心后,隐变量退化为点质量,性能向 MDLM 回落。 同一检查点、同一采样器下,关闭混合使 NFE=1 的生成困惑度从 626.1 升到 1079.5,NFE=2 从 389.0 升到 834.2,而样本熵基本不变。 该消融在已训练权重不变的前提下只改变路由采样方式;论文另报告 E-MoE 的路由 KL 在无 warmup 情况下稳定在约 2 nats/token,而 VADD 的隐变量 KL 降至约 0.1 nats/token 并保持低位。
启示与展望
该结果面向低 NFE 的少步生成场景,即每个反向步同时揭示多个 token 的设定;随着去噪步数增加,收益自然减弱。适用对象是本身已具备专家路由的 MoE 骨干,论文特别提到 LLaDA 风格与 LLaDA-MoE 这类架构,因为路由决策已经存在,只需重新解释为离散共享隐变量并训练其协调多 token 预测。实验覆盖二维合成密度、二值化 MNIST 与 LM1B 无条件生成,均在匹配骨干、优化器与训练预算下比较。
论文自述方法依赖有意义的路由对齐:若噪声序列上的路由器无法恢复干净序列的路由决策,或路由分布塌缩,混合会退化为单一因子化分量。收益随 NFE 增大而收窄,因此其价值集中在少步区间。此外,本次载入的正文中部分附录表格与图(如 MAUVE 精确数值表、生成样本图、训练曲线)以占位形式出现,具体数值与样本细节无法在此核对,这些是需要打开原文确认的开放问题。
