跳到主要内容
返回时间线
arXiv来源发表:

G²PTQ 在量化每个 Transformer 块前刷新梯度与 Hessian,2-bit 下把 KL 散度较 GPTAQ 减半并提升 6.45% 问答准确率

核心概要

该工作提出 G²PTQ,一个在全局监督的块级目标下同时利用一阶与二阶信息的训练后量化框架:它在量化每个 Transformer 块之前重新计算梯度与 Hessian 估计以避免陈旧,并用信赖域缩放约束精确一阶补偿步长,在 0.6B 至 125B 的 13 个稠密模型与 2 个 MoE 模型、2/3/4-bit 权重及 4-bit 权重-激活设置下取得比 GPTQ、GuidedQuant、GPTAQ 等基线更低的 KL 散度与更高的下游问答准确率。

AI-generated editorial illustration: G^2PTQ: Improving LLM Post-Training Quantization with Generalized Gradient Compensation

深度剖析

G²PTQ 把 GPTQ 式的二阶补偿与一阶梯度补偿统一在块级监督目标下:对中间块最小化量化块与全精度块输出的块级 MSE,对最后一个块使用 KL 散度,从而在保留全局监督的同时引入一阶信息。 此前带全局目标的方法(如 GuidedQuant)只使用二阶信息,而引入一阶项的方法(如 FOEM)局限于逐层 MSE 目标;该工作把两者合并到同一块级目标中。 论文给出块级 MSE 与 KL 散度两种目标的 Hessian 近似定理(定理 1、定理 2),并说明块级 MSE 可捕捉块内非线性交互、末块 KL 直接对齐预测分布。

在量化每个 Transformer 块之前刷新梯度与 Hessian 估计,可避免全局目标方法中固定 Hessian 随量化推进而变得陈旧的问题。 已有全局目标方法(OAC、GuidedQuant、YAQA)在量化开始前用一次全模型反向传播算好 Hessian 并保持不变;G²PTQ 改为每块单独做一次反向传播来刷新估计。 消融实验显示,在 Qwen3-0.6B 的 3-bit 设置下,块级对齐把平均问答准确率从 GPTQ 的 33.09% 提升到 37.40%,刷新信息后进一步升至 38.61%;论文同时指出刷新是梯度补偿的前提,否则初始全精度权重处梯度为零。

针对精确一阶补偿会因梯度与 Hessian 数值尺度差异导致权重更新爆炸的问题,引入信赖域缩放机制动态限制梯度步长。 FOEM 用一阶泰勒展开近似梯度以保持数值稳定,但该近似仅在逐层 MSE 下精确;G²PTQ 改用反向传播计算精确梯度,并以信赖域缩放保证更新落在泰勒近似有效的邻域内。 消融表中去掉信赖域缩放后 KL 升至 2.53e+01、PPL 升至 1.29e+12、问答准确率跌至 28.97%,论文据此说明该机制对稳定性是必要的。

论文给出块级 Hessian 近似与精确梯度补偿的高效实现,使复杂度与原始 GPTQ 相当,并报告了实际校准开销。 通过递归更新与惰性批处理(lazy-batch)把朴素实现的高复杂度降到与 GPTQ 同级,并实现 Triton 内核与面向大规模 MoE 的分布式量化优化。 论文报告在单加速器上量化 8B 模型需 2.24 小时、12.54 GB 内存;125B 的 Qwen3.8-Flash-Next 在 8 个加速器上 G²PTQ* 每设备 86.72 GB、20.30 小时,而 GPTQ 为 19.48 GB、7.98 小时。

启示与展望

该结果面向需要在无重训练条件下压缩大语言模型权重与激活的部署场景,适用于论文评估的 LLaMA3、Qwen3、Qwen3.5、Qwen3-MoE 与 Qwen3.8-Flash-Next 等模型族以及 2/3/4-bit 权重和 4-bit 权重-激活设置。它使后续工作可以在块级监督目标下同时使用刷新的一阶与二阶信息,并把信赖域缩放作为稳定精确梯度补偿的通用手段;论文还显示,为 3-bit 调好的信赖域阈值可直接迁移到 2-bit、4-bit 与 Qwen3-0.6B-Base,无需重新调参。对实践者而言,这意味着在单加速器上量化 8B 模型(2.24 小时、12.54 GB)或在 8 加速器节点上量化 125B MoE 模型是可行的,代价是比 GPTQ 更高的校准内存与时间。

论文报告的是特定模型族、位宽与校准数据下的结果,其他架构或数据分布下的表现仍需验证。消融显示 G²PTQ 通常需要比 GPTQ 更多的校准样本才能达到最佳精度,校准集大小与输出通道分组数之间的取舍仍是开放问题。Hessian 引导的权重裁剪在 Qwen3 上带来提升、在 Qwen3.5 上无收益甚至略有下降,论文将最优裁剪方法的选择留作未来工作。此外,本证据包为全文解析,部分附录表格与图(如校准集大小曲线、最优阈值可视化)在文本中以引用形式出现,其具体数值未在此完整呈现,因此相关细节只能依据正文描述理解。

来源