跳到主要内容
返回时间线
arXiv来源发表:

LSPD把在线策略蒸馏改写成KL正则RL:六个数学推理基准上Avg@16平均提升1.59分,回放变体只用约四分之一rollout批次即达饱和

核心概要

该工作把在线策略蒸馏(OPD)的反向KL目标重新解释为KL正则化策略优化,提出最小二乘策略蒸馏(LSPD):用稳健二次对数概率匹配加熵正则替代策略梯度更新,从而支持多次更新与历史轨迹复用,在六个数学推理基准和三种师生设定上平均提升Avg@16 +1.59分、Pass@16 +1.87分,其全离线回放变体LSPD-RB仅用约四分之一rollout批次即达到与原始OPD相当的性能。

AI-generated editorial illustration: An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning

深度剖析

论文给出OPD反向KL目标的精确改写:固定参考策略后,OPD等价于以教师相对参考策略的对数似然比为奖励的KL正则化策略优化,而非额外加正则项。 此前已有工作注意到OPD与KL正则RL的联系,但该文把这一联系写成逐token的精确等价,并据此把值函数式RL中的乐观估计与离线数据复用引入蒸馏。 属于理论推导层面的等价性论证,论文明确说明这是“exact reformulation of OPD rather than an additional regularization term”,并给出逐前缀的KL链式分解。

由此得到的LSPD用稳健(Huber型)二次对数概率匹配加显式熵正则作为实用目标,天然支持同一批rollout多次更新以及从回放缓冲中采样更新。 常见OPD实现依赖PPO/GRPO式策略梯度且基本在线,历史数据复用与探索支持有限;LSPD把更新写成对累积前缀–token对的匹配,使离线优化成为目标本身的性质。 方法层面给出目标函数、Huber阈值设计与算法流程;消融显示去掉熵正则后Avg@16平均仅小幅变化,而Pass@16在全部方法–基准比较中下降,说明熵项主要作用于解的覆盖度。

在六个数学推理基准、三种Qwen3师生设定(8B→4B、4B→1.7B、1.7B→0.6B)上,LSPD平均Avg@16为31.60、Pass@16为53.30,优于最强基线EOPD(+0.91/+0.85)与标准OPD(+1.99/+2.27);LSPD-RB的Pass@16进一步升至54.86。 相对既有蒸馏基线,该结果同时报告了平均生成准确率与多样本覆盖度,并在Pass@k随k增大时表现出更强的扩展性(Pass@32/64平均58.51/61.94,高于EOPD的57.00/60.43)。 18个模型–基准组合的表格结果,LSPD在11/18取得最佳或并列最佳Avg@16,两个变体合起来在36个指标–设定组合中均进入前二;Pass@扩展实验在AMC23、AIME24、AIME25上报告至k=64。

全离线回放变体LSPD-RB在约10个训练步内达到饱和性能,而基线需要40步以上,论文称其用约四分之一rollout批次即可达到与原始OPD相当的性能。 这把值函数式RL的离线数据复用优势具体化为可测量的rollout预算节省,并显示每批rollout的更新次数增加会提升样本效率、但在超过一定次数后收益递减。 训练曲线与步数对比来自AMC23、AIME24、AIME25上的Qwen3-4B教师→1.7B-Base学生设定,每步采集64个提示、每个提示4条回答;理论侧给出理想化乐观形式在在线探索下的对数级反向KL遗憾界。

启示与展望

该结果面向以数学推理为训练域的LLM蒸馏场景,适用于具备教师模型逐token反馈、且学生与教师存在足够覆盖(论文Assumption 6.1所设条件)的师生设定;实验使用Qwen3系列三种规模配对与DAPO-Math-17K训练数据,评测覆盖MATH-500、Minerva、Olympiad-Bench、AMC23、AIME24、AIME25,并附GPQA、MMLU、WinoGrande、HumanEval的域外检查。对希望降低rollout预算的实践者,LSPD-RB的回放缓冲路径提供了可复用的工程选项;对理论读者,理想化乐观形式在在线探索下的对数级反向KL遗憾界给出了与SFT/前向KL的对照视角。

论文的遗憾界针对理想化乐观形式,实用目标用Huber型稳健惩罚与熵奖励替代逐点乐观项,两者之间的差距在正文中未给出定量桥接;离线复用带来的收益在超过一定更新次数后递减,其拐点在不同模型规模与数据分布下是否一致仍待观察;域外评测虽显示GPQA、MMLU、WinoGrande、HumanEval上未出现明显退化,但训练域仍限于数学数据,其他能力维度的保持情况需要更多证据;此外,本证据包为全文解析,部分表格数值在文本中以占位形式出现,具体超参数与个别百分点需回到原文表格核对。

来源