跳到主要内容
返回时间线
arXiv来源发表:

PrismQuant 把激活主能量旋进分组量化的零空间,在 Llama-3.1-70B 上以 W4A4KV4 达到 3.85 困惑度、仅比全精度低 0.22 个百分点

核心概要

该工作提出 PrismQuant:把旋转设计与分组非对称 INT4 量化器自身的“组内常数子空间”对齐,将旋转设计写成 Ky Fan 迹最大化并给出闭式最优解,用紧凑 Householder(compact-WY)实现、无需梯度训练,在 Llama、Qwen、Mistral 上(含 70B 稠密模型与 30B 混合专家模型)做 W4A4KV4 实验,Llama-3.2-3B 上在困惑度与准确率上优于所比较方法,Llama-3.1-70B 上取得 3.85 困惑度与 72.46% 平均零样本准确率(比全精度低 0.22 个百分点),并在 Llama-3.1-8B 部署研究中相对匹配 FP16 基线取得预填充与 CUDA Graph 解码加速、解码峰值内存

AI-generated editorial illustration: PrismQuant: Optimal Null-Space Rotations for Grouped Quantizers

深度剖析

论文把分组非对称量化器的“组内常数方向”识别为一个范围无关(range-null)子空间:组内共享的电平不抬高该组极值,而由格式本就存储的仿射偏移承载,因此旋转设计可以变成“把激活主能量送进这个子空间”的谱问题。 此前旋转类量化方法(QuaRot 的固定 Hadamard、SpinQuant 的学习旋转、DuQuant 的结构化块旋转等)主要优化激活几何,把量化器当作给定条件;另一类方法先从 token 统计中找离群方向再特殊处理。PrismQuant 反过来把量化器已有的自由子空间当作目标,离群值只作为“被旋转捕获的能量”进入,而不是先被定位的方向。 论文给出该子空间的定义与投影分解(式 2、式 3),并说明这是对现有量化器性质的显式化,不需要额外的均值减法操作;正文以 4 维数值示例说明主导分量映射后对范围的贡献从 20 降到 0。

旋转设计被形式化为 Ky Fan 迹最大化,并给出对该对齐目标可证最优的闭式解;实现上用紧凑 Householder 反射与 compact-WY 表示,无需梯度训练,可折叠进相邻权重或在在线位置以“块 Hadamard + 秩-r 修正”执行。 相对需要学习旋转或逐层优化缩放的方法,这里的最优子空间由标定统计量直接给出,且构造与实现分离:估计经验二阶矩与构造旋转是两步,都不需要优化任务损失。 命题 1 由 Ky Fan 最大原理给出最优性证明(附录 B.2);附录 B.3 给出 Householder 构造与 compact-WY 表示的推导,并说明在线修正秩至多为 r、每 token 计算与存储远低于稠密变换;附录 A.1 报告在接入量化器前,每个旋转的重构往返相对误差低于给定阈值,折叠后的模型逐 token 复现 bf16 参考。

论文给出把未对齐激活能量与组大小联系到量化步长的“范围律”,并据此讨论元数据预算:更细的分组同时带来更细的尺度分辨率与更大的可对齐子空间,而在相同激活比特预算下,把预算用于更细分组比在更大分组内增加仿射方向更有效。 这把“组大小”从单纯的元数据成本与局部分辨率问题,扩展为同时决定可对齐子空间维度的设计变量,并用元数据匹配的消融直接展示该权衡。 附录 C 推导残差能量对聚合平方范围的确定性上界与两因子范围律,其唯一近似是一个实测的波峰因子比(在 q/k/v 输入接近 1,在下投影输入为给定区间);表 6a 在共享比特预算下比较不同组大小与表示方向数,报告默认配置在两个 Llama 模型上更优;附录 C.3 报告预测步长排序与实测困惑度排序一致(Spearman 相关系数给出)。

在 W4A4KV4 后训练量化实验中,PrismQuant 在 Llama、Qwen、Mistral 系列上取得所比较方法中最低的困惑度,并扩展到稀疏路由的混合专家模型;部署研究显示其在线变换开销很小。 相对元数据匹配的 Hadamard 基线,论文报告在 3B、8B、70B 上分别弥合了给定比例的 bf16 困惑度差距,并在 70B 上八个任务全部优于 Hadamard;在 Qwen3-30B-A3B 上每个专家使用各自旋转、路由器保持 bf16 不变,恢复了 Hadamard 损失的大部分准确率。 表 1 报告 Llama-3.2-3B、Llama-3.1-8B、Llama-3.1-70B 的困惑度与八任务零样本准确率,结果取三个随机种子平均;表 2 报告 Qwen3-30B-A3B 的稠密与 MoE 对比;附录 A.2、A.3 给出 Qwen3 稠密家族与 Mistral-7B-v0.3 结果;附录 D 在单张 NVIDIA A40 上报告 Llama-3.2-3B 与 Llama-3.1-8B 的预填充、解码与显存数据,并说明性能基准使用随机权重、属于内核替换性能测试而非模型质量评估。

启示与展望

该结果面向使用分组非对称 INT4 激活量化、GPTQ INT4 权重与 KIVI 式 KV 缓存策略的后训练量化部署场景,适用于 Llama、Qwen、Mistral 系列中从 0.6B 到 70B 的稠密模型以及 Qwen3-30B-A3B 这类稀疏路由模型;旋转在残差流、值投影后与下投影输入前等标准位置施加,可折叠进相邻权重或在在线位置以块 Hadamard 加秩-r 修正执行。对读者而言,这提供了一条可复用的设计思路:先问量化器本身能免费表示哪些方向,再决定旋转把能量送到哪里;也提供了把组大小同时视为分辨率与对齐容量两个杠杆的元数据预算视角。论文还指出,若存在原生消费分组非对称激活的 INT4 GEMM,可把当前测得的变换开销进一步转为检查点级系统收益。

范围律的预测器在 q/k/v 输入处较准,但在下投影输入处系统性偏保守,论文把偏差归因于“移除对齐能量后残差形状改变”这一假设,并给出实测波峰因子比作为诊断;这意味着该预测更适合用于配置排序而非绝对步长估计。对齐秩的最优值随模型变化,中间秩的恢复率并非单调,论文因此把 r=8 作为部署工作点而非普适最优。部署证据在共享的打包 INT4 流水线内成立,性能后端使用逐 token 对称激活量化与不同于论文原生分组非对称精度协议的 KV 接口,二者不构成检查点级的精度—速度联合测量;论文也记录了共享后端中大口径累加器 FP16 转换失败这一数值限制。此外,论文说明量化可能保留或改变底层模型的偏见与不安全行为,量化精度提升不应被解读为安全性或公平性的证据。就本次阅读而言,正文与附录给出了方法、证明、消融与部署数据,但部分图表以图像形式呈现,若需逐点核对具体数值仍应查阅原文图表。

来源