SoloQ 用免校准旋转量化把扩散语言模型压到 4 比特,在 LLaDA、Dream、Fast-dLLM v2 与 Nemotron-Labs-Diffusion 上保持精度并超过需校准基线
核心概要
作者提出 SoloQ:用 K-RPBH 旋转把权重与激活映射到可预测的近似高斯分布,配合仅尺度偏差校正实现免校准 4 比特量化,并对块扩散模型在块提交时量化 KV 缓存;在 LLaDA-Base、LLaDA-1.5、Dream-7B、Fast-dLLM v2 与 Nemotron-Labs-Diffusion 上,SoloQ-C 与 SoloQ-N 在 W4A4 及 W4A4KV4 下保持精度,平均分超过 DLLMQuant++、STaR-Quant、FAIR-Calib 等需校准基线,NVFP4 路径还降低峰值内存并加速端到端推理。
Figure 1: Profiling and motivation for SoloQ . (a) Memory breakdown at batch size 128 and aggregate linear/attention latency at batch size 1 for Fast-dLLM v2 ( Wu et al., 2026a ) across context lengths on an H200 GPU. (b) Layer-wise variation in down_proj input activation scale across denoising steps, normalized to the first step. (c) Accuracy of PTQ ( Ashkboos et al., 2024 ; Frantar et al., 2022 ) with WinoGrande/MMLU calibration versus calibration-free SoloQ .
arXiv深度剖析
SoloQ 把权重和激活旋转到 K-RPBH 基,使坐标边缘分布可预测,从而无需校准数据即可量化。 已有 dLLM 训练后量化方法依赖校准数据来跟踪随掩码状态和去噪步变化的激活分布;SoloQ 改为把分布变换成可预测形式,并用仅尺度偏差校正恢复沿原向量的分量。 论文给出 Proposition 1 的跨块方差平均证明,并在 Dream-7B 与 Nemotron-Labs-Diffusion 的 FFN 下投影激活上验证旋转后边缘更接近高斯目标;消融显示同时加入随机置换与跨块混合器后 KL 从 0.11396 降到 0.00413,块能量不平衡从 67.89% 降到 22.12%。
同一可预测旋转表示同时支持分布匹配码本(SoloQ-C)与硬件原生 NVFP4(SoloQ-N)。 此前免校准量化多面向图像或视频扩散 Transformer,或只覆盖权重;SoloQ 把该思路扩展到扩散语言模型,并让两种量化路径共享同一旋转基。 在 LLaDA-Base 上 SoloQ-C 平均 57.74、SoloQ-N 57.60,均高于 DLLMQuant++ 的 54.29;在 LLaDA-1.5 上 SoloQ-N 达 68.48,比 DLLMQuant++ 高 4.17 分;附录 D.2 显示换成普通均匀 INT4 的 SoloQ-I 仍取得 56.98、67.44、55.32 的平均分。
对块扩散模型,SoloQ 在块提交时量化 KV 缓存,只压缩持久状态而不扰动正在去噪的块。 已有 dLLM 量化工作主要面向全序列扩散模型;SoloQ 把免校准设计扩展到块扩散模型的持久 KV 状态,键用 KIVI 式逐通道非对称量化,值走 SoloQ 激活路径。 在 Fast-dLLM v2 与 Nemotron-Labs-Diffusion 上,RTN 与 AWQ 在 W4A4 下崩溃(平均 6.67、6.61 与 1.30、1.28),QuaRot 因维度不支持无法用于 Fast-dLLM v2,而 SoloQ 在 W4A4 与 W4A4KV4 下保持较高平均分;约 3 BPE 的 KV 量化对比中 SoloQ-C 53.31、SoloQ-N 53.53,高于 KIVI 50.26、OScar 46.62、TurboQuant 4.03。
K-RPBH 在保持精度的同时比稠密 Haar 旋转快得多,并优于 RPBH。 RPBH 的块内结构会留下块间能量不平衡,且缺少跨块校正;K-RPBH 加入 Haar 随机正交跨块混合器来重新分配残余块统计量。 在 Fast-dLLM v2 上旋转延迟从 Haar 的 98.135 ms 降到 5.779 ms,在 LLaDA-1.5 上从 0.559 ms 降到 0.048 ms;相比 RPBH,K-RPBH 在 LLaDA-1.5 的 HellaSwag/MMLU 为 73.86/64.70,高于 RPBH 的 73.08/63.48。
启示与展望
该结果面向需要在有限显存或边缘设备上部署扩散语言模型的研究者与工程师,适用于全序列 dLLM(LLaDA、Dream)与块扩散 dLLM(Fast-dLLM v2、Nemotron-Labs-Diffusion)的 W4A4 与 W4A4KV4 场景。SoloQ-C 走 8 比特 Tensor Core 内核,SoloQ-N 走原生 NVFP4 内核;论文还在 Zynq UltraScale+ ZCU104 FPGA 上实现 NVFP4 加速器,报告相对 BF16 的端到端加速与更高能效。后续可沿两条线推进:一是把可预测旋转表示推广到更多扩散语言模型与更低比特设置,二是把旋转折叠进相邻权重以降低在线开销。
在线激活旋转会带来额外推理开销,折叠进相邻权重虽能降低成本,但附录 D.3 显示折叠拓扑在低比特下可能带来与模型相关的精度下降,块扩散模型上尤为明显;SoloQ-C 的非均匀码本以 INT8 无损表示质心,无法直接利用原生 4 比特 Tensor Core,加速幅度低于 SoloQ-N;SoloQ-N 的完整延迟收益依赖硬件对原生 NVFP4 的支持。此外,注意力汇位置在 W4A4KV4 下保留全精度影响很小,但在更激进的 W4A4KV2 下保留汇位置才有明显收益,超低比特 KV 量化的边界仍值得继续观察。
