ISTA-DASLab 提出“分离式量化”:为预填充与解码分别定制量化格式,1-bit 解码准确率翻倍以上
核心概要
该工作提出“分离式量化”(DQ),把 LLM 推理的预填充与解码两个阶段分别配置计算格式、权重与存储位置,并配套提出 QADD 训练方法;在 Qwen 3 与 Gemma 3 上,仅在解码阶段取消激活量化即可在不增加推理成本的前提下提升解码密集型任务准确率,训练独立的 NVFP4 预填充权重可在 2–3-bit 解码下同时加快预填充并提升准确率,在 Qwen3.8-27B 的 1-bit GGUF 解码器上把 MMLU-Pro 与 MMMU-Pro 准确率提升到原来的两倍以上,并通过从 SSD 流式加载预填充权重的 ODP 在 8K 上下文下取得相对 weight-only 基线的首 token 时延加速。
深度剖析
论文提出量化感知蒸馏与分离(QADD),利用 SFT 标签掩码把预填充/解码分工传入量化层:提示(用户轮)走预填充通路,回答(助手轮)走解码通路,两条通路在一次前向-反向中共同朝同一回答目标优化,既支持共享主权重,也支持只训练预填充以适配冻结解码器。 此前量化感知蒸馏并未把推理两阶段的计算通路分开,QADD 把“阶段分工”从部署层面下推到训练层面,使同一模型可以持有两套阶段专用表示。 方法在 Tülu 3 SFT 语料的 1 亿 token 上训练,序列长度 2048、全局批大小 64、2450 步,FP32 主权重配直通估计器,核心实验覆盖 Qwen 3 的 0.6B/1.7B/4B/8B 与 Gemma 3 的 1B/4B/12B。
论文给出三种互补的分离方案:格式分离(预填充用硬件原生量化计算、解码用低位宽 weight-only)、完全分离(额外训练原生 NVFP4 预填充权重)、以及卸载式分离预填充(ODP,把预填充权重从 SSD 分块流式载入并复用设备缓冲)。 已有工作多只做阶段相关的权重精度或预填充加速,DQ 把硬件原生预填充与压缩 weight-only 解码统一到一个框架里,并进一步把预填充权重的驻留位置也纳入设计。 表 1 在 Qwen 3 与 Gemma 3 上给出 BF16、NVFP4A16、NVFP4、3-bit 与 2-bit weight-only 及各自分离变体的预填充/解码加速比、设备占用与两类准确率;ODP 在 DGX Spark 上以两个设备块缓冲重叠加载与计算,并用等量解码权重空间做缓冲。
在解码密集型任务上,仅取消解码阶段的激活量化即可提升准确率而不增加存储或推理成本;在预填充密集型任务上该改动影响很小。 这说明量化误差对两个阶段的影响并不对称,阶段分离的收益主要落在解码侧,从而支持把格式分离当作即插即用的替换方案。 论文先单独量化某一阶段到 NVFP4 以建立敏感性:解码单独量化造成的准确率损失约为预填充单独量化的若干分之一,在 Gemma3-1B 上差距最大;预填充密集型任务上预填充单独量化的损失约为解码单独量化的若干分之一(八个模型中的七个)。表 1 中格式分离在解码侧比非分离方案快 2–3%,预填充加速比最高约 1.49x(Qwen3-8B)与 1.67x(Gemma3-12B)。
训练独立的 NVFP4 预填充器可以增强任意冻结的 weight-only 解码检查点:在 Qwen3.8-27B 的 1-bit GGUF 解码器上,MMLU-Pro 与 MMMU-Pro 准确率提升到 weight-only 的两倍以上,同时预填充更快、并通过 ODP 保持设备内存不增加。 这使分离式量化不必重新训练已有的、可能由闭源或复杂算法产出的量化解码器,只需为其训练一个预填充器,解码量化流程可以保持黑箱。 使用 Unsloth 发布的八个预量化 GGUF 检查点(含 IQ2_XXS 等向量量化格式),每个格式做一次完整评测;1-bit 解码增益最大,2-bit 增益较小,3-bit 时 NVFP4 预填充器反而带来轻微下降;在 8K 上下文下首 token 时延从若干秒降到若干秒,4K–32K 范围内加速比有区间,短提示下 ODP 因 SSD 加载更慢。
启示与展望
该工作面向已做过后训练的指令微调模型,因为分离式量化需要逻辑上的输入/输出分工;评测覆盖解码密集型推理任务与单轮预填充密集型任务,解码为 batch-one,预填充栈时延在 DGX Spark 上测量,ODP 的首 token 时延在 llama.cpp 中测量。格式分离适合设备内存紧张、又需要保留原模型交互性的单用户服务;完全分离适合低并发分离式服务(两个检查点本就常驻加速器)以及通过 ODP 的本地单用户服务;预填充器方案适合已有 weight-only 量化检查点、希望复用而不重训解码器的场景。作者同时发布了复现代码、支持 ODP 的 llama.cpp 分支以及训练好的 Qwen3.8-27B 预填充器。
论文未评测高并发批处理、多轮与智能体行为;作者指出多轮场景中缓存的助手 token 保留解码产生的 KV 条目,而用预填充重建同一段历史可能得到不同表示,这种对缓存策略的依赖尚未测试。ODP 在短提示下会因 SSD 加载而变慢,且作者认为该思路不易迁移到 MoE 模型。预填充器会改变生成所依赖的表示,附录显示 MMLU-Pro 上多数格式的中位生成长度下降但平均长度上升,说明解码权重不变并不保证生成成本不变。此外,预填充器与解码器之间的可互换性只在最低位宽上部分成立,训练时配对哪一解码器会影响收益。本总结基于论文全文,但表格中的部分数值在文本中以占位形式呈现,具体点数需回到原文表格核对。
