OSFP4 联合优化对角平滑与分块缩放,在 Llama-3.1-8B-Instruct 上取得 77.03 的 W4A4 平均准确率并保留约 94-97% 的 NVFP4 预填充吞吐
核心概要
该工作提出 OSFP4:通过分析乘性抖动 FP4 量化器,得到可微的矩阵乘积量化误差近似,据此对每个线性投影联合优化对角平滑矩阵与权重分块缩放,并针对 RTN 或 GPTQ 式 SIC 舍入分别构造损失;在 Llama-3.1-8B-Instruct 上,W4A4 配置取得所评估方法中最高的平均准确率,同时保留约 94-97% 的厂商 NVFP4 预填充吞吐。
Figure 1: Normalized mean-squared error of randomized FP4 quantization, ϕ ( x ) = 𝔼 [ ( x − Q ~ FP4 ( x ) ) 2 ] x 2 \phi(x)=\frac{\mathbb{E}[(x-\tilde{Q}_{\mathrm{FP4}}(x))^{2}]}{x^{2}} , and its deterministic counterpart, ϕ exact ( x ) = ( x − Q FP4 ( x ) ) 2 x 2 \phi_{\mathrm{exact}}(x)=\frac{(x-Q_{\mathrm{FP4}}(x))^{2}}{x^{2}} .
arXiv深度剖析
论文给出对角平滑 NVFP4 量化下矩阵乘积误差平方 Frobenius 范数期望的近似表达式,作为平滑参数与分块缩放的函数,并区分 RTN 与 SIC 两种舍入过程。 以往 SmoothQuant 式对角缩放主要针对 INT 星座的无穷范数平衡,而 NVFP4 的 E2M1 动态范围过小,需要不同的准则;该表达式把实际使用的舍入反馈纳入平滑优化。 推导基于乘性抖动 FP4 量化器与高分辨率量化假设,并在附录 I 给出完整推导;Lemma 1 给出该抖动量化器相对 MSE 的最小值及其取到最小值的区间。
基于该近似提出 OSFP4 两阶段流程:先对对角平滑与分块缩放做连续联合优化,再在 E4M3 网格上做离散权重缩放选择;激活分块缩放默认用 absmax-to-6。 与仅优化缩放(如 H-Scale、ScaleSweep)或仅做旋转(如 MR-GPTQ)的方案相比,该方法把平滑与缩放放在同一目标下联合优化,且对角变换可折入 LayerNorm/RMSNorm。 附录 B 给出 Adam 迭代、对数参数化、查表插值求导与尺度归一化的实现细节;附录 C 给出 RTN 与 SIC 下不同的 E4M3 尺度选择算法。
在 Llama-3.1-8B-Instruct 上,W4A4 的 OSFP4 W-SIC/X-RTN 平均准确率为 77.03,高于 FP-Quant GPTQ 的 76.34、MR-GPTQ 的 76.18 与 H-Scale 的 76.67;W4A16 的 OSFP4 W-SIC 为 78.42,高于 H-Scale 的 78.00 与 BF16 的 79.22 之下的其他量化方法。 在相同评测协议下,仅用对角变换而非旋转即取得更高的 W4A4 平均准确率;消融显示联合优化平滑、加权 MSE 尺度选择与 SIC 三者叠加时困惑度最低。 评测覆盖 MMLU-CoT、GSM8K、HellaSwag、WinoGrande 四项任务,本地模型共享同一 BF16 检查点与 1024 条 2048 token 的 FineWeb-Edu 校准集,经 vLLM 在 RTX 5090 上评测;附录 H 给出七类投影的相对 MatMul MSE 与 WikiText-2 困惑度消融。
在 NVIDIA B200 上,OSFP4 保留约 94-97% 的厂商 NVFP4 预填充吞吐;将平滑矩阵设为单位矩阵的对照取得与 OSFP4 基本相同的吞吐。 说明与厂商 NVFP4 路径的差距主要来自注意力输出与 MLP down 投影处无法折入 LayerNorm 的显式对角平滑运行时实现,而非平滑系数的取值。 附录 G 给出预填充与解码的完整工作负载扫描、三次独立计时重复各 30 次推理运行的协议,以及 BF16、厂商 NVFP4、单位平滑 NVFP4 与 OSFP4 的对照。
启示与展望
该结果面向使用 NVFP4(E2M1 数值、每 16 个输入通道一个 E4M3 分块缩放、FP32 张量缩放)的 LLM 训练后量化部署场景,主要证据来自 Llama-3.1-8B-Instruct,附录另给出 Llama-3-8B、Qwen3-8B、Qwen3-30B-A3B-Instruct 与 Gemma-4-31B-IT 的结果。对角平滑在存在 LayerNorm/RMSNorm 的层可折入其中,在注意力输出与 MLP down 投影处需显式运行时平滑,因此吞吐收益依赖工作负载。方法默认激活分块缩放用 absmax-to-6,并可与在线激活尺度搜索(ScaleSearch/ScaleSweep)叠加;MoE 模型上作者使用专家专属平滑矩阵,但因未实现路由感知的服务路径,Qwen3-30B-A3B-Instruct 仅报告 W4A16 结果。
抖动量化器误差模型中的零均值、单位方差与跨条目/跨块独立属于建模假设,而非量化误差的精确性质;SIC 分析还依赖高分辨率量化假设。附录 E 的投影级测量使用与优化相同的经验激活分布,作者明确说明这是校准诊断而非留出泛化测试。部分对比方法(ScaleSweepMSE、4over6、SOAR、H-Scale 及其 W4A4 扩展)为作者自行实现,NVIDIA 发布检查点的准备过程不受控,因此跨方法比较的解读需结合这些来源差异。此外,正文中若干数值在加载文本中未完整呈现,具体数字需以原文表格为准。
