跳到主要内容
返回时间线
Hugging Face来源发表:

把LLM剪枝当作物理问题:块移除作为伊辛优化

核心概要

该工作将大语言模型的块移除选择重新表述为约束二元优化问题,等价于在伊辛玻璃中寻找低能态,用一次校准得到的近似Hessian能量作为下游质量的廉价代理,从而无需逐次基准测试即可排序海量候选配置;在Llama-3.3-70B-Instruct上以50%压缩率(移除40/80块)不重训练时MMLU保持在约77,而最强基线块影响法降至约54,并在Llama-3.1-8B-Instruct、Qwen3-14B以及混合架构NVIDIA-Nemotron-3-Nano-30B-A3B-FP8上验证了该表述的迁移性。

AI-generated editorial illustration: Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem

深度剖析

将块移除选择形式化为约束二元优化,物理上等价于全连接耦合、磁化强度守恒的伊辛玻璃,每个二元变量对应一个transformer块保留或移除。 既有块移除方法多按块独立打分(幅度、敏感度、块影响等启发式),在物理语言中属于平均场近似,且常只移除单段连续块;该工作通过二阶泰勒展开得到近似Hessian,其非对角项显式刻画块与块之间的成对耦合。 方法层面给出了从损失二阶泰勒展开到Hessian、再到能量xᵀH⁰x与QUBO映射的推导链条,并在多个模型上给出结果;原文为文章式概述,完整推导与消融在论文中。

该伊辛能量是下游基准质量的强而廉价的代理:Hessian只需在小校准集上做一次前向与反向传播即可获得,之后评估任意候选配置仅需一次能量计算,且同一Hessian可复用于不同压缩目标M。 相比需要实际运行或基准测试每个候选配置的做法,该代理把候选排序成本降到单次能量计算,使在单GPU上暴力枚举数十亿自旋配置成为可能。 报告了在单GPU上暴力枚举可达数十亿配置,最难的可行案例为移除Llama-3.3-70B的80块中的8块(约290亿配置)耗时约两天;超出该范围后改用QUBO求解器。

在深度压缩区间,考虑耦合的CBO显著优于块影响基线:Llama-3.3-70B-Instruct不重训练时,移除32/80与40/80块,CBO的MMLU分别为76.6与76.9,基线为59.3与54.0,最深设置下MMLU优势接近23个百分点;Qwen3-14B移除12/40块时CBO在MMLU上领先约10个百分点。 在轻度压缩时两者相当,差距随压缩加深而扩大,说明块间耦合在大量移除时最为关键,这正是平均场式独立打分丢失质量的地方。 给出了Llama-3.3-70B-Instruct不重训练的具体MMLU数值表(原始82.2),并称在最深设置下CBO在所有测试基准上均优于基线;原文为文章式概述,完整结果表在论文中。

最优剪枝往往不是基态而是低激发态:Llama-3.1-8B-Instruct移除16/32块时,第17激发态首次提出移除靠近模型前部的块,经轻度重训练后在多个基准上超过基态。 这直接挑战了“最佳剪枝是一段位于中部或后部的连续块”的常见假设,并说明读取基态与低激发态几乎免费,可提供一组高质量候选而非单一脆弱答案。 以Llama-3.1-8B-Instruct在16/32块移除下的具体激发态为例,并称重训练后该配置在多个基准上优于基态;原文为文章式概述,细节见论文图2。

启示与展望

该结果面向需要在有限算力下深度压缩大语言模型的工程与研究场景:先在小校准集上一次性构建近似Hessian,再在单GPU上暴力枚举或交给QUBO求解器(如开源tabu搜索)生成候选块移除配置,并可复用于不同压缩目标M。它适用于同质堆叠与交错Mamba2、注意力、MoE的混合架构,且被定位为可与量化、低秩/SVD压缩、宽度剪枝和基于知识蒸馏的修复组合的流水线组件。

原文为文章式概述,未给出校准数据集的具体规模与构成、Hessian近似的误差范围、各基准的完整分数表、重训练的具体设置,以及tabu等求解器与暴力枚举在更大模型上的一致性验证范围;能量代理“强但不完美”的边界、低激发态优势在不同模型与压缩率下的稳定性,以及混合架构中冗余分布不均的普遍性,仍是值得在完整论文中进一步确认的开放问题。

来源