跳到主要内容
返回时间线
arXiv来源发表:

RIDE 把 RL 教师的隐藏状态残差外推,在四个基座/教师对上均值追平或超过教师

核心概要

该工作提出 RIDE(RL-Induced Direction Extrapolation):在学生自采样轨迹上,逐层计算 RL 教师与其 RL 前检查点之间的隐藏状态残差,把学生的表示回归目标沿该残差外推到教师之外,在四个基座/RL 教师对(R1-Distill-1.5B、Qwen3-4B、Llama-3.2-3B、Phi-4-mini)上于 AIME24、AIME25、AIMO 的 Avg@16 均值均接近或超过 RL 教师,是唯一均值做到这一点的对比方法,并一致优于输出空间外推。

AI-generated editorial illustration: The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation

深度剖析

论文把“RL 教师相对其 RL 前检查点的逐层隐藏状态差”定义为 RL 诱导的表示残差,作为 RL 改变了模型何种计算的度量;在共享初始化的蒸馏设定下,教师与 RL 前检查点都可得。 此前把 OPD 视为带隐式对数比奖励的 KL 约束 RL,外推发生在输出空间或参数空间;这里把 RL 带来的变化直接放在表示空间、在每一层、在语言模型头之前测量。 残差由两次前向(教师与 RL 前检查点在同一学生前缀上)确定性算出,而非采样得到;论文给出该残差在每一层、每个 token 位置的定义与实现说明。

RIDE 用单一系数把表示匹配的目标沿该残差外推到教师之外,系数为 1 时精确退化为 OPRD;条件于一条 rollout,该回归等价于在教师处的二次惩罚下最大化由残差定义的线性方向奖励。 输出空间外推的目标在共享线性头下是 RIDE 目标的头投影像;RIDE 保留奖励外推的解释,但用确定性的隐藏状态梯度替代采样 token 的对数比。 论文给出命题 4.2 的推导:最小化到目标的平方距离等价于最大化“内积奖励减二次惩罚”,最优解为教师加残差方向上的位移;并说明只有目标不同,故系数为 1 时与 OPRD 完全一致。

在四个基座/RL 教师对上,RIDE 的 Avg@16 均值在每一对上都接近或超过 RL 教师,是唯一均值位于教师线之上的方法,并一致优于 OPRD 与输出空间外推 ExOPD。 论文把“在哪个空间外推”与“是否外推”分开:ExOPD 与 RIDE 使用同一系数与同一 RL 前参考,仅测量位移的空间不同;ExOPD 在每一对上都落到教师之下,在教师与基座差距小的三对上甚至低于未训练学生。 表 1 报告四个基座/教师对在 AIME24、AIME25、AIMO 上的 Avg@16,每个训练方法用三个独立训练种子取运行级均值;RIDE 相对 OPRD 的领先为若干分,论文指出其中三对的领先幅度在一个跨种子标准差之内,Llama-3.2-3B 对的证据主要来自 AIMO。

机制分析显示语言模型头对残差的衰减是各向异性的,且输出空间外推会放大采样 token 的噪声,而 RIDE 的梯度在给定 rollout 后是确定性的。 论文用命题 4.1 给出输出空间优势在采样 token 上的条件方差随外推系数二次增长,而 RIDE 的逐位置梯度对重采样下一个 token 不变;并用方向对照实验说明增益来自 RL 诱导残差本身。 残差只保留等范数各向同性方向头增益的一小部分,其能量集中在最弱的头方向上;随机方向、反向、来源不匹配、轨迹不匹配四种对照在固定位移幅度下都落在 OPRD 附近(相差一个点以内),而使用 RL 诱导残差的 RIDE 更高。

启示与展望

该结果面向共享初始化的蒸馏场景:学生从教师的 RL 前检查点出发,教师、基座与学生共享架构、分词器与表示原点,因此逐层隐藏状态可直接比较;典型用途是把一次昂贵的 RL 结果蒸馏回其基座模型,或合并共享基座的领域专家。方法需要保留 RL 前的检查点,使用单一全局外推系数,并在每一层与最后若干响应位置上做表示回归;实现上只在教师 worker 上多跑一次冻结前向,传输量与 OPRD 相同。论文评估限于数学推理基准(AIME24、AIME25、AIMO)与一套 RL 配方,作者把放宽这些约束、以及研究以隐藏状态为目标训练的学生的安全性与校准,列为后续工作。

论文自述的开放问题包括:方法依赖 RL 前检查点与共享表示空间,只使用单一全局系数,且仅在数学推理与一套 RL 配方上评估。读者还会关注:三对基座/教师上的领先幅度落在跨种子标准差之内,Llama-3.2-3B 对的证据主要来自 AIMO;系数扫描部分使用单一种子,与三种子均值存在约一个标准差的差异。此外,学生被监督在没有任何模型真正产生过的隐藏状态目标上,其校准与安全行为不保证与教师一致,作者建议部署前独立评估;由于外推把目标推到教师之外,教师从 RL 继承的偏差或错误在原理上可能被放大而非仅被复制。本总结基于论文全文与首页证据包,未包含训练代码与检查点(作者称发表后释放),因此复现细节仍需以论文附录为准。

来源