跳到主要内容
返回时间线
arXiv来源发表:

DRQ 在固定量化网格上最小化最坏情况重建损失,使六种 PTQ 方法量化的 LLM 困惑度与下游准确率同时改善且不增加推理开销

核心概要

作者发现权重仅量化 PTQ 中校准数据上更低的重建损失并不保证更好的模型表现,甚至可能在同一校准数据上变差;他们据此提出 DRQ,在受限的输入激活分布集合上最小化最坏情况重建损失,仅更新量化权重的整数编码而保持位宽、分组、缩放与零点不变,在六种 PTQ 方法以及稠密与 MoE 模型上同时降低困惑度并提升平均任务准确率,且不增加推理开销。

Source-provided article image: When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization
Figure 1 ·

Figure 1: Lower reconstruction loss need not improve quantized model performance. Results are from Llama-3.2-1B-Instruct with 3-bit quantization. (a) Among 32 modifications to AWQ-quantized weights, 18 reduce reconstruction loss but increase model PPL on the same WT2 calibration data. (b) Among 560 modified weight matrices per method that reduce reconstruction loss on calibration data, 413 (73.8%) for AWQ and 264 (47.1%) for GPTQ increase model PPL on held-out WT2 data. (c) Further minimizing reconstruction loss increases held-out C4 PPL by 0.69%, whereas DRQ accepts slightly higher reconstruction loss on calibration data and lowers C4 PPL by 0.32%. Each evaluation modifies one linear layer, keeping all other weights fixed. In (a,c), reconstruction loss is divided by its initial value, and PPL changes are relative to the initial quantized model.

arXiv

深度剖析

论文报告了一个反直觉现象:在校准数据上进一步降低重建损失,并不必然改善量化模型表现,甚至可能在同一校准数据上使表现变差。 此前权重仅 PTQ 普遍以最小化校准数据重建损失作为保持低精度模型质量的主要准则,本文把“校准拟合”与“部署表现”之间的差距作为独立问题提出并加以刻画。 在 Llama-3.2-1B-Instruct 的 3-bit AWQ 上,对 16 层用两组 WT2 校准集产生 32 个修改权重矩阵,其中 18 个重建损失更低但同一校准数据上的 PPL 更高;另一实验中 560 个重建损失更低的替换里有 413 个(73.8%)使 PPL 上升。

论文给出输入激活分布变化下重建损失比较被反转的条件,并据此构造最坏情况重建目标。 分析把重建损失对输入的依赖归结为激活二阶矩矩阵的变化,并在正半定扰动与分布变化预算约束下给出精确判据,从而把鲁棒性写成可优化的目标而非启发式正则。 Theorem 3.1 给出充要条件,Theorem 3.2 把内层最大化化为沿单一输入方向的最坏情况方向误差,并证明该方向由特征值问题给出;附录给出证明与达到该损失的分布变化。

DRQ 作为事后精修框架,只更新量化权重的整数编码,保持量化格式与推理算子不变,因此不增加推理开销。 与改变缩放、裁剪、旋转或重建目标的 PTQ 方法不同,DRQ 在既有量化网格内改进权重选择准则,可与多种基础 PTQ 方法叠加使用。 在 Llama-3.1-8B W4A16、组大小 128 的 vLLM 基准中,精修后 prefill 与解码时间变化在很小范围内,模型张量占用内存相同;离线精修在 20 组配置下 GPTQ 与 AWQ 平均约 6.01 与 5.96 分钟。

DRQ 在多种模型规模、位宽、基础 PTQ 方法与稠密及 MoE 架构上同时改善困惑度与平均任务准确率。 论文把精修效果从单一方法扩展到六种代表性 PTQ 方法(含 AWQ、GPTQ、ParoQuant)以及稠密与 MoE 模型,显示即使初始量化已较强仍可获益。 Llama-3.1-70B GPTQ W2 上 C4 PPL 由 31.77 降至 27.11、准确率由 48.23% 升至 54.56%;Llama-3.2-3B GPTQ W3 上 C4 PPL 由 30.34 降至 22.11、准确率由 55.83% 升至 60.24%;Qwen3-30B-A3B W3 上 WT2 与 C4 PPL 下降且七项任务中五项准确率提升。

启示与展望

该工作面向权重仅训练后量化的事后精修场景,适用于已有基础 PTQ 方法产出量化权重、且能获得校准激活的部署流程;DRQ 在既有量化网格内更新整数编码,保持位宽、分组、缩放、零点与推理算子不变,因此适合希望在不改动推理栈、不增加推理开销的前提下提升低比特模型质量的研究者与工程团队。论文在 Llama-3.2-Instruct(1B、3B)、Llama-3.1-Instruct(8B、70B)与 Qwen3-30B-A3B 上,于 W4A16、W3A16、W2A16 与组大小 128 的设置下验证,并覆盖 GPTQ、AWQ、RTN、OmniQuant、GPTAQ、ParoQuant 以及 QuaRot 加 GPTQ 的组合。

读者仍需关注若干开放问题:最坏情况方向依赖权重差与激活二阶矩,改变整数编码会改变该方向,因此 DRQ 在每轮重新估计方向,其估计精度与接受规则如何共同影响最终权重值得进一步考察;论文报告在部分 AWQ W2 设置下严重退化仍然存在,说明精修能恢复的质量存在范围;参数 与 的敏感性扫描显示更强的最坏情况惩罚并不一致地改善表现,且有利设置依赖基础 PTQ 方法;MoE 中部分专家接收的校准 token 极少甚至为零,这些层采用 RTN 初始化或退回权重距离项,其精修效果与稠密层不同。

来源