跳到主要内容
返回时间线
arXiv来源发表:

IntBMoE:用块级条件化把专家参与度、执行量与参数物化解耦

核心概要

该工作提出 IntBMoE,一种块级条件化的混合专家架构:用小型可学习码本定义若干可复用的多层块,由共享超网络把每层全部专家基合并成组合专家,再用路由器为每个 token 只选择少数块执行,从而在保持全池参与的同时维持稀疏执行与有界参数物化,并在 ImageNet-1K 图像分类上取得 73.76% Top-1、91.48% Top-5,在 MiniPile 语言建模与 IntTravel 序列推荐上同样优于所比较的稀疏与稠密 MoE 基线,且已在 AMap 生成式推荐系统中全量部署,在线 A/B 测试获得 2.4% 的相对 UVCTR 提升。

AI-generated editorial illustration: IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts

深度剖析

把混合专家的三个量——参与度、执行量、参数物化——解耦为可独立设定的维度。 既有设计把三者绑定:稀疏路由压低执行与物化但缩小参与(“non-selected experts neither affect the token’s output nor receive a learning signal from it”),稠密输出混合恢复全参与但执行随专家数增长,参数合并把执行压到单个专家却让物化随路由决策数增长;IntBMoE 让全池先构造有界的一组可复用变换,再由 token 独立选择执行其中少数几个。 论文给出复杂度分析:组合全部块的成本为 O(N·L·d²) 量级、执行所选块为 O(N·k·L·d²),组合项对可复用块只付一次;ImageNet-1K 上以约 24M 总参数、23.111M 激活参数达到 73.76% Top-1。

用码本加共享超网络生成“组合配方”,使块参数与输入无关、可预计算与缓存。 与逐 token 或逐段做参数合并的 SMEAR、Lory 不同,IntBMoE 的条件信号来自有限且与输入无关的码本嵌入,超网络只生成组合系数而非直接生成完整权重矩阵,因此组合块可跨路由决策复用;作者将其描述为“a basis-constrained hypernetwork with bounded parameter materialization”。 缓存后推理成本从 4.063 GFLOPs 降至 3.457 GFLOPs;随专家池从 1 增至 128,未缓存时峰值内存与算力上升,缓存后分别稳定在固定值与固定 GFLOPs,且从 16 个专家起缓存更省内存。

Dual-Path Residual Gating(DPRG)通过乘性门控耦合两条独立组合路径,在不扩大专家池的前提下提升表达力。 每条路径本身仍由专家基线性组合而成,DPRG 在 value 路径与 gate 路径之间引入残差乘性调制,使整体对专家基呈非线性;消融显示去掉 gate 路径的损失最大(ImageNet-1K Top-1 从 0.7376 降至 0.6804,MiniPile PPL 从 14.5878 升至 15.8947)。 ImageNet-1K、MiniPile、IntTravel 三个数据集上的组件消融一致显示 gate 路径影响最大,且参数匹配的单层块变体也低于完整两层块。

全池参与是“有效”的,且块确实学到了彼此不同的组合配方。 作者不只声称全池参与,还逐层移除专家基做验证:在 Layer 0、2、4、6 共 64 个移除设置中,移除任一被检专家基都会降低 Top-1,最小降幅为 0.26 个百分点;同时同一层内不同块对同一专家基给出不同正负权重,配方差异随深度增大。 移除实验在原始 checkpoint 上不重训,并对权重尺度变化做了补偿;value 路径块配方平均两两余弦相似度从 Layer 0 的 0.796 降至 Layer 6 的 0.010,gate 路径从 0.726 降至 0.043。

启示与展望

该结果面向需要在有限算力与内存下扩大专家容量的模型设计者,适用于视觉分类、自回归语言建模与序列推荐等设定;缓存机制要求模型参数在推理期固定,从而把块合成移出请求路径,因此其收益在训练期与推理期表现不同。对延迟敏感的生产系统,论文给出的适用条件是固定块配置与预计算缓存,AMap 场景中即在此前提下满足 60ms 预算。

读者仍会关心:块配方差异随深度增大这一现象在更大骨干与更多 MoE 层下的走向;专家基移除实验只覆盖 Layer 0、2、4、6 的 16 个基,其他层与更大池的贡献分布尚待观察;线上 A/B 为一周实验,长期效果与不同业务场景的迁移性仍是开放问题;此外本证据包为全文解析,若需核对具体图表数值与附录细节,仍应回到原文。

来源