跳到主要内容
返回时间线
arXiv来源发表:

共享低秩基分解SLBF在16B至122B五种MoE架构上以无数据方式压缩专家权重并持续优于剪枝、合并与重建基线

核心概要

作者对MoE压缩的三大类方法(专家剪枝、专家合并、权重重建)做了结构误差分析,推导出剪枝与合并存在与路由和专家异质性相关的不可消除误差,而权重重建因保留专家结构与路由可规避这类代价;据此提出无数据的共享低秩基分解(SLBF),用专家间共享的低秩基替代满秩基,并配合双线性规范固定去除冗余参数,在16B至122B的五种MoE架构上一致优于三类基线。

Source-provided article image: Shared Low-rank Basis Factorization for Data-free Mixture-of-Experts Compression

(a) Pair-level structural costs.

arXiv

深度剖析

论文给出三类MoE压缩干预的统一结构代价分析,并为专家剪枝与权重重建推导了新的误差界,指出剪枝与合并的误差含有一个由专家移除或路由绑定引入的结构项,而权重重建的误差仅由参数重建残差控制。 此前工作多按经验比较压缩方法,这里把剪枝、合并、重建放在同一成对分析框架下给出可比较的误差表达式,并明确结构项在何种条件下消失(路由静态或专家功能相同)。 推导在成对专家、弱相关近似下完成,并扩展到SwiGLU式FFN,前因子由原始权重范数与激活的Lipschitz常数决定;作者在Qwen3-30B-A3B与Mixtral-8x7B上以C4激活统计显示两个结构量在每一MoE层均严格大于零并随深度增长3–4个数量级。

提出共享低秩基分解(SLBF),把MoBE中每个满秩共享基替换为秩-r分解,使固定压缩预算下可容纳更多基,专家得以在多个基上组合而非集中于单一主导基。 相对MoBE的少量满秩基,SLBF以“多而简单”的基换取更丰富的跨专家共享;作者指出低秩基的预激活混合在r取满时可达与MoBE相同的每基秩,因此该替换不损失每基表达上限。 在固定预算下SLBF收敛更快、重建MSE更低,Mixtral-8x7B全部32个MoE层均如此;在Qwen3-30B第4层gate_proj上扫描基数量,最优区间约为基数量与专家数相当,作者据此采用基数量等于专家数。

提出双线性对称规范固定,利用分解在可逆变换下的不变性消除每个基中的冗余参数,且不改变表示能力。 该步骤把冗余参数回收为更高的每基秩,属于对已有双线性分解对称性的工程化利用,而非改变模型形式。 消融显示未加规范固定的SLBF已在各压缩比下优于MoBE,规范固定带来一致的次级增益,且在更激进的压缩下增益更大;作者报告所训练因子的列满秩条件在实验中均成立。

在五种MoE架构(16B至122B)上以无数据、压缩后不微调的一次性设置评测,SLBF在推理、知识、数学与代码等基准上一致优于三类压缩家族的代表方法。 相对同族的MoLAE与MoBE,SLBF在匹配投影范围时即已领先,并可把预算分配到全部三个FFN投影获得额外增益;相对剪枝与合并方法,其优势在更高压缩比与更多架构上扩大。 Qwen3-30B在24%压缩下SLBF平均84.3,MoBE为82.8,剪枝/合并基线下降超过8分;Gemma4-26B上相对MoBE领先14.3分,Qwen3.5-122B上领先5.2分;Moonlight-16B在15%压缩下平均分仅降1.8分,而MoBE降9.9分、MoLAE降超过30分;Mixtral-8x7B在24%压缩下平均70.7、WikiText-2困惑度6.92,优于最强剪枝基线EAN(70.2/8.28)与最强合并基线HC-SMoE(69.1/8.54)。

启示与展望

该结果面向需要在有限显存或分发带宽下部署MoE大模型的工程与研究场景,尤其是希望在不引入校准数据、不做压缩后微调的前提下保留稀疏路由结构的一次性压缩流程。方法在权重空间逐层、逐投影独立拟合,因此天然可并行,适合按层或按投影分片处理大型检查点。作者报告在Mixtral-8x7B的运行时解压服务模式下,权重显存下降30%,释放的内存转为KV缓存预算,使最大并发请求数提升53%,吞吐保持在原基线的相近水平,说明该方案在推理服务侧具备可操作的落地路径。适用性以论文评测的架构与压缩比范围为界:五种MoE架构、16B至122B参数、约15%至37%的总模型压缩比,且Mixtral上仅压缩gate与up投影、down投影保持满秩。

结构误差界建立在成对专家、弱相关近似与线性或SwiGLU专家的简化设定上,其在更复杂路由与更大专家规模下的紧致程度仍是开放问题。评测为单次运行,作者说明初始化确定因而在固定超参下可复现,但未报告多次运行的方差。压缩后不微调、不使用校准数据,因此校准引导的预算分配与微调恢复残余精度损失未被探索;与量化、注意力压缩等其他压缩轴的交互也未涉及。分解结构在模型与层间固定,逐层或逐投影自适应选择基数量可能带来进一步改进。部署评测覆盖的硬件与服务配置有限,运行时解压存在内存与吞吐的权衡,直接加载分解表示在当前实现中对大型MoE可能带来可观的重建开销。此外,原文以公式与图表承载关键推导与曲线,本次解析中这些公式与图注内容不可见,因此对误差界的具体形式与图1、图2、图3、图4、图5的数值细节只能依据正文文字描述,读者若需精确表达式应查阅原文附录。

来源