跳到主要内容
返回时间线
arXiv来源发表:

S²D-OPD 只保留每条回答中教师-参考 JSD 最高的 10% 状态,在八个师生设定中的七个把留出准确率从 46.36% 提到 47.31%

核心概要

该工作指出 Direct-OPD 的 token 级对数比奖励只衡量相对变化,可以在教师与参考检查点分配给学生的候选 token 的概率质量趋于消失时保持不变,而教师-参考 JSD 与两个方向的 KL 会随之消失;据此提出 S²D-OPD,按教师-参考 JSD 对学生采样状态排序并屏蔽低散度状态上的监督,每条回答只保留最高的 10%,在两个教师对和四个 1.7B 至 8B 学生模型上,于 AIME 与 HMMT 留出基准的八个设定中有七个优于稠密 Direct-OPD、第八个持平,且不需要额外前向传播。

AI-generated editorial illustration: Not Every Token Is Worth Distilling: Selective Supervision for Direct-OPD

深度剖析

论文通过一个精确构造说明 Direct-OPD 的奖励与其对学生局部梯度可以保持不变,而教师与参考检查点之间的 JSD 以及两个方向的 KL 散度随学生候选 token 上的概率质量一起消失;同时给出 JSD 对教师行为变化量的界。 此前 Direct-OPD 与 Proxy-OPD 把 RL 前后检查点的 token 级对数比当作稠密监督,默认每个状态的政策偏移都值得蒸馏;该工作把“对数比只看相对变化、对绝对概率质量不敏感”这一点做成可证明的构造,并指出低 JSD 意味着教师行为变化很小。 证据来自正文第 4.1 节的精确构造与命题 1(附录 B 给出证明),以及基于 Pinsker 不等式的 JSD 界;这是分析性结果,不依赖实验数据。

提出 S²D-OPD:用教师-参考 JSD 对学生采样状态打分,在每条回答内只保留得分最高的 10% 状态,并在被屏蔽状态上同时去掉奖励项与学生锚定 KL 项;打分复用 Direct-OPD 已经计算的教师与参考概率,因此不增加前向传播。 与按学生不确定性、教师置信度或师生分歧做选择的既有选择性蒸馏准则不同,该准则读取的是 RL 前后教师检查点之间的散度,即政策偏移本身的大小。 方法在正文第 4.2 节给出,包含在 top-k 候选集加残差 token 上的 JSD 定义、按回答的选择规则与掩码目标;实现细节见附录 A。

在两个教师对(R1-Distill-1.5B→JustRL-1.5B、Nemotron-1.5B→QuestA-1.5B)和四个学生(Qwen3-1.7B/4B/8B、R1-Distill-7B)上,保留 10% 状态在 AIME 2026、HMMT 2025 年 11 月与 2026 年 2 月三个留出基准上,八个设定中七个优于稠密 Direct-OPD、一个持平;按 93 道留出题做配对自助与单侧符号翻转检验,平均留出准确率由 46.36% 升至 47.31%,提升 0.95 个百分点(95% CI 0.40–1.54)。 此前缺少证据说明稠密 Direct-OPD 的逐状态监督是否都有效;该工作给出跨教师对、跨学生规模的留出比较,并报告在 JustRL 教师对下前 60 步不落后于稠密监督、后期更稳定。 证据为表 1 与图 2 的对照实验,评测用 Avg@32,验证集为 AIME 2024/2025,留出集为三个晚于所有学生模型发布的基准;作者在附录 F 说明每个配置只训练一次,置信区间来自留出题重采样而非训练种子。

受控分析显示稠密监督在很大程度上是冗余的:随机抽取 10% 状态达到峰值验证准确率 51.2,与稠密 Direct-OPD 的 51.3 相当;在同一 10% 预算下按 JSD 分位分箱训练,性能随分位上升,最高箱达 52.9,而最低的三个箱低于学生初始化、最低两个箱崩溃;跨教师对看,整体 JSD 更低的 QuestA 教师对从掩码中获益更大(1.0–1.7 分,JustRL 为 0.0–1.2 分)。 这把“保留多少状态”与“保留哪些状态”区分开:收益来自过滤低散度监督,而不是把监督集中到绝对散度更高的状态上。 证据为第 5.3 节固定教师对、学生、数据与超参、只改变进入目标的状态集合的分箱实验(图 3),以及图 4 的跨教师对比较;附录 C 用 top-k 重叠给出机制线索,附录 E 的案例为手工挑选、用于说明打分行为而非估计频率。

启示与展望

该结果面向以数学推理和可验证奖励为场景的弱到强策略迁移:教师侧检查点公开、无需自行运行 RL,学生规模在 1.7B 至 8B,教师为 1.5B,评测使用 AIME 2026、HMMT 2025 年 11 月与 2026 年 2 月三个晚于学生模型发布的留出基准。可直接沿用之处在于打分复用 Direct-OPD 已算的教师与参考概率,因此不增加前向传播,且 5%–20% 保留率、按回答或按批次选择、JSD 或前向 KL 打分都给出相近结果,便于在同类蒸馏流程中替换选择环节。作者把自适应保留率与数学推理之外的领域列为自然的下一步。

JSD 只衡量教师相对参考改变了多少,不判断改变是否正确:附录 E 的案例显示一个把错误答案推向更高概率的偏移(JSD 0.1197,高于该回答 0.0744 的保留阈值)同样会被保留,因此被保留监督的质量仍取决于教师的 RL 结果。打分只通过学生的 top-k 候选集间接依赖学生,学生已经跟随的偏移与尚未学会的偏移消耗同样的预算。证据规模上,教师为 1.5B、学生至多 8B,而弱到强迁移最有价值的场景是更大的学生;全部实验限于数学推理与可验证奖励,代码生成或智能体任务中 RL 偏移的分布是否类似尚未检验。作者在附录 F 说明每个配置只训练一次,置信区间来自留出题重采样而非训练种子,因此逐设定的比较仍有待重复运行加强。此外,本次读取的文本中部分公式与图表以占位形式呈现,涉及具体数值的细节以正文叙述为准。

来源