WUSH-KV 用数据自适应变换把 2-bit KV 缓存困惑度从 OSCAR 的 13.74 降到 10.51,并在 8B 四项下游任务上全面领先
核心概要
该工作把原本用于权重-激活量化的 WUSH 变换迁移到分组查询注意力的 KV 缓存上,用校准数据为每个 KV 头分别构造键变换与值变换(值变换折进权重、键变换置于 RoPE 之后),在 QuEST 量化器下证明该变换在灵敏度均衡的变换类中近最优,并在 SGLang 中以 OSCAR 式百分位裁剪仿射量化做端到端评测:2-bit 下 Qwen3-8B 的 WikiText-2 困惑度为 10.51(OSCAR 13.74),8B 的 AIME 2025、MATH-500、GPQA Diamond、LiveCodeBench v6 四项均高于 OSCAR。
深度剖析
把 WUSH 从权重-激活量化推广到 KV 缓存量化,为每个 KV 头分别构造键、值两个变换:键变换考虑消费该键的查询头,值变换考虑输出投影块,二者都由校准期统计量以闭式构造。 此前的变换类方法(QuaRot、SpinQuant、FlatQuant、RotateKV、TurboQuant 风格 Hadamard)多用正交或随机旋转;与本文并行的 OSCAR 也把键值变换限制为正交,而 WUSH-KV 允许一般可逆变换,从而能做各向异性缩放,同时兼顾缓存统计与下游敏感度。 论文给出变换的闭式构造(式 1、式 4)与离线校准算法,并在 Qwen3-8B 全部 36 个注意力模块上以 128 条 FineWeb-Edu 序列校准、32 条序列评测做受控消融。
在 QuEST 量化器下给出裁剪感知的近最优性结论:在加性舍入噪声模型与归一化尾部、裁剪对齐等条件下,理想 WUSH 变换在“灵敏度均衡”的可逆变换类中达到最优(相差一个与位宽无关的常数因子)。 已有变换类工作多依赖经验比较,缺少针对裁剪量化器的理论刻画;本文把无裁剪情形的最优性(定理 3)与裁剪误差的上下界结合,给出显式有限比特界。 定理 2 与附录 B 的证明建立在显式假设之上,作者也说明该保证针对理想变换,而实验使用带阻尼的版本。
受控重建实验显示 WUSH 降低注意力阶段误差:2-bit 下键值同时量化时,模块输出几何平均误差为 WUSH 与 WUSH-A 的水平,低于 Hadamard 与 OSCAR;困惑度实验中 WUSH 在每个位宽都取得最低困惑度,2-bit 为 10.51 对 OSCAR 的 13.74。 该实验固定使用同一 QuEST 量化器,从而把变换质量与量化器设计分离开来,这是相对以往混合比较的一个更干净的对照。 重建实验覆盖 36 个模块、2/3/4 比特;困惑度在 WikiText-2 上以 2048 长度不重叠序列、16 token 前向分块计算,校准为 128 条长度 32768 的 FineWeb-Edu 序列,单张 L40S 上约 12 分钟、峰值 39 GiB。
端到端集成到 SGLang 并使用 OSCAR 式百分位裁剪仿射量化后,2-bit 下 WUSH-KV 与 OSCAR 相当或更好:8B 上四项基准全部更高,4B 与 32B 大体接近,且在 OSCAR 明显退化时(如 8B、32B 的 LiveCodeBench v6)优势更大;长上下文 RULER NIAH 与 MRCR 上 WUSH-KV 在最长测试长度保持更高分数。 这是在与 OSCAR 相同的量化器与缓存策略下做的直接对比,且作者说明未针对 WUSH 重新调优裁剪比例,因此该比较对 OSCAR 相对有利。 评测覆盖 Qwen3-4B-Thinking-2507、Qwen3-8B、Qwen3-32B 与 AIME 2025、MATH-500、GPQA Diamond、LiveCodeBench v6,三次随机种子采样;长上下文部分报告 RULER NIAH 4k–128k 与 MRCR 0k–128k 的分段结果。
启示与展望
该结果面向使用分组查询注意力、可离线校准并运行在支持分页 KV 缓存的推理系统(如 SGLang)中的大语言模型服务场景;对希望把 KV 缓存压到 2-bit 同时保持推理与代码任务质量的工程团队最直接可用。方法本身与标量量化器解耦,可搭配逐 token 裁剪量化器,值侧变换折进权重后不增加在线开销,键侧变换因置于 RoPE 之后需在线应用。理论保证针对 QuEST 量化器与灵敏度均衡变换类,端到端评测则使用 OSCAR 式百分位裁剪仿射量化器。
键侧变换必须在线应用,作者将其列为额外推理计算,并指出未来可研究更廉价的结构化变换与系统级吞吐评测;端到端评测复用了 OSCAR 的裁剪比例而未针对 WUSH 重新调优,作者提示这里可能仍有空间;OSCAR 基线的部分分数未能完全复现,比较是在同一 SGLang 流程下重跑的;MRCR 对所有量化方法都较困难,相对 BF16 仍有明显差距;此外本次载入的是论文全文文本,图表以文字描述形式出现,具体曲线数值需回到原文图 1 至图 3 核对。
