跳到主要内容
返回时间线
arXiv来源发表:

专家混合语言模型中专家的高阶剪枝

核心概要

该工作提出 HOPE,一种二阶专家剪枝目标:在校准阶段记录每层专家对的交互矩阵 F,并将其作为二次规划求解以选择剪枝集合,理论上证明 REAP 等一阶方法是忽略交互项的特例;在三个前沿 MoE 模型(最高 122B 参数)、两套校准集与多个基准上,HOPE 在多数条件下取得最佳平均排名,50% 剪枝时平均排名 1.58(次优方法 REAP 为 2.42),在智能体编码任务上最高提升 +6.1%。

Source-provided article image: Higher-order pruning of experts in mixture-of-experts language models
Figure 2 ·

Figure 2: The interaction matrix F F recorded by HOPE exhibits expert cooperation. a) F F -matrix for GLM-4.5-Air at three representative layers (early, middle, late). Experts have been hierarchically clustered per layer for visualization. Visible block structure indicates groups of experts with high pairwise interaction scores. b) Distribution of diagonal vs off-diagonal terms in F F across all layers (GLM-4.5-Air). Off-diagonal (interactive) terms are substantial in magnitude (compared to the diagonal), showing that pairwise interactions are a non-negligible component of the pruning objective.

arXiv

深度剖析

提出二阶剪枝目标 HOPE,把专家剪枝写成在交互矩阵 F 上的二次规划 p⊤Fp,其中对角项刻画单个专家贡献、非对角项刻画专家对的协同贡献。 此前的一阶方法(Frequency、EAN、REAP、MAN)为每个专家独立打一个标量重要性分数,忽略专家之间的交互;HOPE 首次把成对交互纳入剪枝决策。 论文给出完整推导(附录 A):将剪枝误差分解为替换误差与重归一化误差,证明替换误差的平方被 (1+ρ)²·Z 上界约束,并证明最小化 E[Z] 等价于求解该二次规划(定理 1、定理 2)。

证明 REAP 是 HOPE 在忽略交互项时的特例:F 的对角线 F_k,k=E[(g_k‖f_k‖)²] 与 REAP 分数的平方仅相差专家贡献的方差,且将非对角项置零后 HOPE 经验上恢复与 REAP 相同的剪枝集合。 把已有最强一阶方法纳入新框架,说明 HOPE 相对 REAP 的任何提升都可直接归因于非对角交互项。 理论推导之外,论文报告 F_k,k 的平方根与 REAP 分数的 Spearman 相关接近完美(ρ=0.988,图 S4)。

在 3 个 MoE 模型(Qwen3.5-122B-A10B、Qwen3.5-35B-A3B、GLM-4.5-Air)、2 套校准集、6 个剪枝率、Tulu3 与 SWE-Bench Pro 基准共 54 种配置上,HOPE 总体平均排名最佳(2.07),头对头胜率平均 73%;剪枝率越高优势越明显,40–50% 时平均排名 1.58。 此前方法未在如此多模型、校准集与剪枝率组合上系统比较二阶与一阶剪枝;HOPE 在高剪枝率这一最具部署价值的区间优势最大。 每个条件在 3 次独立校准试验上报告均值与标准差(表 S1–S6);50% 剪枝时 HOPE 在智能体编码上对 REAP 平均领先 +2.8%、最高 +6.1%;HOPE 仅在 1/54 条件中垫底(差距 -1.7%),而 REAP 有 5 次、Frequency 有 43 次垫底。

分析显示 F 的非对角项并非噪声:其平均幅值约为对角项的 33%,呈现块状结构;当 HOPE 与一阶方法分歧时,HOPE 更倾向保留与其他存活专家交互更强的专家。 给出二阶剪枝为何有效的机制证据,说明一阶方法会被专家的“自我重要性”误导而忽略协同结构。 基于 GLM-4.5-Air 各层 F 矩阵的聚类可视化与对角/非对角分布统计(图 2),以及按分歧分类的专家协同分数比较(图 3);剪枝集合分歧分布于全部层(图 4b)。

启示与展望

该结果面向采用 top-K 路由的 MoE 语言模型(实验中为 128–256 个专家、top-8 路由),在编码、数学、指令遵循与智能体编码等基准上验证;方法按层独立剪枝,共享专家不参与剪枝,且与量化可叠加使用。对希望在同一硬件上换取更长上下文、更多并发请求或更长推理链的部署者,HOPE 提供了在高剪枝率下仍保持性能的剪枝方案;论文还给出跨层扩展 CHOPE 的理论框架与初步结果,用于探索非均匀的逐层剪枝预算。

HOPE 目前只建模到二阶(成对)交互,更高阶交互在组合上难以量化;跨层扩展 CHOPE 的初步结果显示其非均匀预算分配可能带来不稳定,论文建议加入逐层最小专家数约束;此外,剪枝集合在不同校准域之间的一致性低于同一域内的重复试验(HOPE 平均校准 Jaccard 为 0.60,REAP 为 0.61),因此校准数据的选择仍是读者需要留意的变量。

来源