跳到主要内容
返回时间线
arXiv来源发表:

把输出头做一次等价重参数化,Phi-4-mini 的 W4 AW-MSE KL 从 0.936 降到 0.256,并保住 10.8% 的批一延迟收益

核心概要

该工作提出 softmax 重参数化:在量化前从输出头每一行减去词表行均值的某个标量倍数,用验证集 KL 分别为 RTN、AW-MSE 和全 Hessian GPTQ 选择系数,在保持全精度 softmax 分布与解码器不变的前提下改善低比特输出头保真度,例如 Phi-4-mini 上 AW-MSE 的 W4 KL 从 0.936 降至 0.256,并在打包 W4 部署中把批一生成延迟相对 BF16 头基线降低 10.8%。

AI-generated editorial illustration: Softmax Reparameterization for Output-Head Quantization

深度剖析

作者提出一种训练后的一维搜索:在输出头的加性 softmax 等价类中,沿词表行均值方向减去标量倍数,并按量化后模型与源模型的验证 KL 选择系数,搜索范围包含原始头与固定均值中心化。 已有工作把 softmax 对称性与均值中心化用于注意力键或预训练稳定,这里把该自由度用于量化前的输出头代表元选择,并按量化后预测保真度而非权重范数来选。 论文给出等价性推导(softmax 只依赖相对 logits),并在七个头上用 128 篇 WikiText 拟合、16 篇验证、16 篇评估的划分做对比;Phi 的 14 点 GPTQ 扫描约需十二分钟。

在 W4 下,收益集中在基线量化严重扭曲预测的头上:Phi-4-mini 的 AW-MSE KL 从 0.936 降到 0.256,XGLM 的 RTN KL 从 2.129 降到 0.143,BLOOM/BLOOMZ 也明显改善;而 Gemma 3/4 与 Qwen3.5 基线 KL 本就很低,变化很小。 相对固定均值中心化,验证集选出的系数在 Phi、BLOOM、BLOOMZ 上更优;在 XGLM 上三种量化器都选中均值中心化本身。 表 2 给出四个头在 RTN/AW-MSE/GPTQ 下的原始、中心化与重参数化 KL;Phi 上验证选出的系数把 RTN 测试 KL 从约 1.23 降到约 0.35,约为固定中心化的一半。

该增益在更强 GPTQ 校准、精确逐通道缩放和仿射量化下仍然存在,并可迁移到 C4 与 OpenWebMath:冻结 WikiText 选出的系数在 18 个系数不为 1 的比较中全部优于均值中心化,其余 6 个 XGLM 情形持平。 说明这不是校准数据不足或缩放手段缺失造成的假象,而是与既有量化改进互补的一步。 Phi 上 GPTQ 校准从 1,024 增至 65,536 状态后原始 KL 由 0.160 降到 0.089,重参数化进一步降到 0.035;缩放 AW-MSE 从 0.240 降到 0.172,仿射 RTN 从 0.750 降到 0.259,配对自助区间均排除零。

机制上,被选中的代表元可能增大普通 logit 重构误差,却把误差移到 softmax 不敏感的方向:Phi 上从系数 0 到 4,原始 logit 误差能量在 RTN 下增至 3.0 倍、AW-MSE 下增至 2.7 倍,而 Fisher 加权误差下降 72–73%。 这解释了为什么按权重或 logit 重构误差选择代表元会失败:附录 E.2 中权重 MSE 与投影 MSE 在九个比较里都选中系数 1,而诊断 KL 的最优点每次都不同。 表 4 在 8,176 个留出状态上同时给出实际 KL、Fisher 二次型与概率分箱;AW-MSE 下高概率词条上的绝对误差能量下降一半以上,而低概率词条上的误差份额上升。

启示与展望

该方法面向训练后量化、只量化输出头而冻结解码器的场景,适用于线性 softmax 输出头;对 tanh soft-capping 这类非线性 logit 路径需要秩一修正,代价是一次隐藏维点积与一次词表广播。它适合已经使用打包 W4 内核(如 Marlin/vLLM)的部署方,在 shift-compatible 头上不增加推理算子;对绑定权重模型,需要保留 BF16 输入嵌入并单独打包输出头,Phi 的常驻权重从 7.17 GiB 增至 7.47 GiB。系数按量化器分别选择,跨域使用时冻结 WikiText 系数在 C4 与 OpenWebMath 上仍优于均值中心化。

系数选择依赖校准分布:附录 C.3 显示更大的 C4 与 OpenWebMath 验证集可能选出与 WikiText 不同的系数,mC4 五语言研究中法语 RTN 在 1,024 文档下十个种子仍有分歧。FLORES 多语言诊断中 BLOOM 在阿拉伯语与印地语上 KL 上升,说明冻结系数并非普遍可迁移。W2 被作者定位为压缩压力测试,绝对质量在若干配置下仍然很差。机制分析集中在 Phi 的 W4 比较,作者也说明这些测量解释 Phi 的 KL 下降,但不足以断定哪些其他头会受益。此外,本次载入的是论文全文与附录,但部分表格数值在文本中以占位形式呈现,涉及具体单元格数字时以正文明确写出的数值为准。

来源