LSD 用在线自蒸馏把已解出题目的多余长度从 19.0% 压到 -3.7%,同时保持或提升 Pass@1
核心概要
该工作把强化学习后训练中「已解出查询的响应被无谓拉长」定义为长度缩放税(LST),并提出长度自蒸馏(LSD):用当前 rollout 组的正确率把已解出提示路由到在线策略蒸馏、未解出提示保留原 RLVR 目标,教师是同一策略谱系的指数滑动平均检查点、无需外部模型,在单轮推理上把 LST 从 19.0% 降到 -3.7%、在多轮智能体任务上从 31.4% 降到 13.7%,同时平均 Pass@1 与 RL 相当或更好。
深度剖析
论文提出并量化了长度缩放税(LST):在固定「易题集」上,已解出查询的响应长度随 RL 后训练增长,却没有相应的正确率提升。 此前对推理效率的刻画多依赖平均响应长度等粗粒度聚合统计,缺少针对「已解出查询被后续 RL 更新拖长」的系统性指标;LST 以锚点检查点冻结易题集、并以满足正确率门槛的最短平均长度作为参照,从而把这种训练引入的低效单独分离出来。 在 Qwen3-4B-Base 上以去重 DAPO-Math-17K 做标准 group-relative RLVR 后训练,在 AMC 2023、AIME 2025、AIME 2026 上评估;无论用哪个锚点定义易题集,易题集正确率基本稳定而响应长度持续上升。
论文提出长度自蒸馏(LSD):按当前 rollout 组的经验正确率在线路由,已解出组走在线策略蒸馏,未解出组保留原 RLVR 目标。 已有在线策略蒸馏多被当作通用压缩目标,而动态采样会把全对组当作无信息样本丢弃、难度感知课程又会下调易题权重;LSD 恰恰把「相对优势塌缩为零」的全对组作为需要 token 级保持信号的来源。 给出三种实现:监督梯度前向 KL(SG-FKL)、监督梯度反向 KL(SG-RKL)、策略梯度反向 KL(PG-RKL),并分析它们在策略约束粒度上的差异;教师为同一策略谱系的指数滑动平均检查点,不需要更强外部教师或单独提示的简洁模型。
在单轮数学推理与多轮智能体任务上,LSD 在保持或提升基准表现的同时显著压低易题长度增长。 与 RL、CRISP、Fixed SG-FKL、RL + Length Penalty 等基线相比,LSD 的收益不是靠整体缩短响应,而是把缩短集中在已解出查询上。 单轮推理中 LST 从 RL 的 19.0% 降至 SG-FKL 的 -3.7%、SG-RKL 的 -10.92%、PG-RKL 的 1.45%,平均 Pass@1 分别为 44.20%、42.80%、43.56%,RL 为 42.90%;多轮智能体任务中 LST 从 31.4% 降至 13.7%、9.2%、16.1%,SG-FKL 与 SG-RKL 同时减少平均交互轮数并提高 Pass@1,而 RL + Length Penalty 虽长度最短但 Pass@1 从 29.50% 降到 22.58%。
消融显示教师滞后与路由阈值共同决定「保持简洁」与「获取新能力」的权衡。 论文把 LSD 的两个新超参数(EMA 半衰期、路由阈值)与训练中实际送入蒸馏的 token 份额、教师参数滞后、蒸馏损失联系起来,说明保持强度并不等同于更大的蒸馏曝光。 半衰期为 4 时平均 Pass@1 最高(41.85%);把路由阈值从 1.0 降到 0.85、0.75 会把更多部分解出组送入蒸馏,平均 Pass@1 降到 40.91%、39.31%,蒸馏 token 份额从 10.31% 升到 19.00%。
启示与展望
该结果面向使用可验证奖励做 RL 后训练、且训练分布中同时存在已解出与未解出提示的场景,例如单轮数学推理和多轮检索智能体;对希望在不引入外部教师模型的前提下控制推理成本的训练方最有直接价值。论文把 LST 定义为相对「满足正确率门槛的最短平均长度」的超出比例,因此其适用前提是存在一个可冻结的易题集与一个正确率合格的参照检查点;负 LST 表示响应短于该参照,正确率需在同一固定易题集上另行核对。作者在结论中把更大模型上的评估列为后续工作。
易题集由锚点检查点冻结,不同锚点会给出不同的 LST 数值,跨论文比较时需要留意锚点与阈值的选择。三种蒸馏目标的排序并不一致:SG-RKL 的 LST 最低但平均 Pass@1 也最低,PG-RKL 在多轮任务中 Pass@1 最高却用了比 RL 更多的交互轮数,因此「更低 LST」并不自动等于「更少交互」。附录中的个例也显示聚合结论存在边界:aime25_6 上 SG-RKL 与 PG-RKL 的正确率低于 RL,Fixed SG-FKL 在缩短响应的同时正确率明显下降。消融中路由阈值与蒸馏 token 份额、有效蒸馏系数同时变化,论文也说明这些耦合变化不能单独归因于某一个训练信号。此外,训练日志未提供按路由拆分的单条响应长度,因此无法从现有聚合记录还原逐响应长度分布。
