跳到主要内容
返回时间线
arXiv来源发表:

OnlineQAT用学生自生成前缀上的在线策略蒸馏,把Qwen3-1.7B的W3A16六任务均值提升到57.28,超过ReasoningQAT 2.90分

核心概要

OnlineQAT提出两阶段超低位恢复框架:先用分块量化感知训练得到可用的W2/W3初始化,再在量化学生自己生成的响应前缀上,由冻结的全精度教师提供采样反向KL信号做在线策略蒸馏;在Qwen3-1.7B上,其六任务均值在W3A16达57.28、W2A16达32.52,分别比ReasoningQAT高2.90和0.44分,说明学生实际访问的状态能提供固定补全训练之外的恢复信号,三比特下尤为明显。

AI-generated editorial illustration: OnlineQAT: On-Policy Distillation for Ultra-Low-Bit Large Language Models

深度剖析

论文指出离线恢复与部署之间存在前缀分布错配:现有恢复阶段在固定补全或教师生成答案上优化,而部署的量化模型以自己生成的token为条件,量化误差会把模型带入离线恢复数据未覆盖的状态。 相对BitDistiller、EfficientQAT与ReasoningQAT等以固定校准序列或参考补全评估恢复的方法,OnlineQAT把端到端恢复移到学生实际访问的前缀上,同时保留分块QAT初始化。 该错配以图1的示意对比和引言中的推理链说明,属于方法动机层面的论证,而非独立实验测量。

OnlineQAT在Qwen3-1.7B上取得所比较量化方法中的最佳六任务均值:W3A16为57.28,W2A16为32.52。 相对最强离线基线ReasoningQAT,W3A16提升2.90分、W2A16提升0.44分;相对固定前缀蒸馏基线KD,W3A16提升3.62分。 依据表1的六任务无加权均值,所有恢复方法在同一比特宽度下从同一Stage 1检查点出发,Stage 2统一使用AdamW、八GPU、有效批大小64。

W3A16的增益较广,W2A16的增益较小且依赖任务。 相对ReasoningQAT,W3A16在GSM8K、MMLU-R、MATH-500、LiveCodeBench、GPQA-Diamond上均有提升,其中LiveCodeBench与GPQA-Diamond变化最大,IFEval下降0.8分;W2A16在GSM8K、MMLU-R、GPQA-Diamond上提升,但在MATH-500、IFEval、LiveCodeBench上落后。 逐任务分数来自表1;论文明确将W2A16的改进描述为modest and task-dependent。

方法上,Stage 2用单样本策略梯度估计采样反向KL,只对响应token计损失,不含交叉熵项,教师与零点在Stage 2冻结。 与ReasoningQAT在gold补全上使用前向KL并保留教师top-20 logits不同,OnlineQAT在温度0.6下从32,757条OpenThoughts提示采样,训练W3A16 40步、W2A16先30步预热再120步。 目标函数与估计量以公式2至4给出,超参数与训练步数在4.1节列出;论文说明省略反向KL策略梯度中的常数项,因其期望为零。

启示与展望

该结果面向需要在W3A16或W2A16下部署Qwen3-1.7B这类推理模型的工程与研究场景,尤其是希望在不改变模型架构的前提下用在线策略蒸馏替代固定补全恢复的团队。方法依赖一个可用的Stage 1检查点,因此分块QAT初始化仍是前提;Stage 2需要从学生采样响应,因而引入rollout生成成本。论文将结论定位为初步结果,并明确其动机是推动对超低位语言模型在线策略恢复的更广泛评估。

相对ReasoningQAT,OnlineQAT同时改变了前缀分布和KL方向,因此该比较无法分离任一因素的作用;论文也指出缺少离线反向KL对照。研究只覆盖一个模型且没有多种子,W2A16的增益又依赖任务,因此均值差异的稳定性仍需更广评估。此外,OPD需要rollout生成,论文明确表1支持的是经验比较,而非因果或计算效率结论。若读者关心具体公式中的温度缩放细节或各任务方差,需回到原文核对公式与表格。

来源