跳到主要内容
返回时间线
arXiv来源发表:

稀疏交叉编码器揭示:在线策略蒸馏并未给学生模型新特征,而是重加权其与教师共享的既有特征

核心概要

该研究用稀疏交叉编码器与作者提出的 swap readout,在三个在线策略蒸馏(OPD)设置中读取学生模型训练前后对每个特征的使用,发现 OPD 既不创造学生自身的新特征、也不传递教师特有特征,而是小幅重加权学生与教师共享的既有特征(超过 98% 的常用特征放电率变化在 20% 以内),且变化最集中于 Wait、Hmm、So 等“决策词”;对 OPD 之前常见的教师轨迹 SFT 预热,同样不新增特征,而是部分沿 OPD 方向、部分超出该方向地重加权共享特征,把这种重加权直接施加到直接蒸馏学生的特征上(不改权重)可将其准确率提升到接近预热学生的水平。

AI-generated editorial illustration: Understanding On-Policy Distillation: A Mechanistic Interpretability Perspective via Sparse Crosscoders

深度剖析

作者提出 swap readout:把同一学生检查点的激活同时放入交叉编码器的两个学生槽位并固定教师输入,从而单独读出该检查点自身的特征激活,即使该检查点从未参与交叉编码器训练。 既有交叉编码器分析只能通过解码器识别某一模型特有的特征,无法说明模型对特征的使用如何变化,因为所有模型被联合编码进同一组特征激活;作者指出两个学生检查点的激活差异仅为其范数的很小比例,导致各自槽位读出不可靠。 论文给出命题与证明,说明 swap readout 对替换矩阵不变、且在两学生重合时等于联合预激活;在四个三模型交叉编码器上验证,swap readout 对学生的重建质量与联合编码相当,并能同样好地重建未参与训练的检查点。

在三个 OPD 设置(JustRL、Skywork、R1-7B)中,OPD 不创造学生自身特征,也不传递教师特有特征,只是小幅重加权学生与教师共享的既有特征。 此前对 OPD 的分析多基于学生输出(token 概率、准确率、训练信号),本文转向学生内部表征,给出表征层面的解释:OPD 只能重加权共享特征,因而更可能提升采样效率而非扩展能力边界。 三个设置中 OPD 学生均未主导任何特征,其 MAS 分布与基础学生重合;在 M 个留出 token 上,没有特征在 OPD 前后从有到无或从无到有,JustRL、Skywork、R1-7B 分别有 98.9%、98.4%、99.9% 的常用特征放电率变化小于 20%;教师主导的特征在学生侧 MAS 前后均为 0,且无特征 MAS 变化超过 0.01。

OPD 变化最大的特征集中在“决策词”上,即推理轨迹决定下一步走向的位置,且这些特征被推向教师的用法。 这把 OPD 的重加权定位到轨迹中的具体位置,并与教师—学生分歧最大的步骤对应起来,而此前工作未在特征层面刻画这种局部性。 JustRL 下变化最大的特征中决策词特征占 40%(基线 4%),Skywork 下占 30%;决策词处学生替换的特征比平均 token 多 1.5–2 倍,OPD 对下一 token 分布的改变在这些步骤上过表达 2–3 倍;教师与学生的 KL 分歧在这些位置是平均值的 2–3 倍(JustRL)、3–4 倍(Skywork)、1.5–2 倍(R1-7B);R1-7B 下 OPD 对学生的平均 KL 仅为 0.01,约为 JustRL 的十分之一。

OPD 前的教师轨迹 SFT 预热同样不新增特征,而是重加权共享特征:一部分沿 OPD 方向提前完成 OPD 的部分工作,另一部分超出 OPD 方向并持续到 OPD 之后;把这种重加权施加到直接蒸馏学生的特征上(不改权重)可把其准确率提升到接近预热学生。 与 Shi et al. (2026) 中在另一更强模型所写解答上做 SFT 会引入新特征不同,本文的预热停留在 OPD 同一任务、模仿同一教师的 rollout;作者用特征层面的干预而非仅相关性来支持该重加权承载预热收益。 预热沿 OPD 方向移动特征的斜率约为 0.5,OPD 提升最多的特征中 80% 在预热后同向移动;预热变化的 60% 落在 OPD 方向之外(剔除一个在乱码字符上放电的特征后为 55%),该残差在后续 OPD 后仍保留(Spearman 0.75,随机旋转对照为 0.05);干预实验中直接蒸馏学生 avg@8 从 18.6 升至 21.3,预热学生从 21.9 降至 19.2,打乱特征身份对照则分别为 15.9 与 23.4。

启示与展望

这项工作面向研究 OPD 内部机制的研究者与需要设计后训练流程的工程团队,适用于学生与教师共享特征字典、且以推理任务(数学推理)为主的 OPD 与教师轨迹 SFT 预热场景。它给出的 swap readout 可用于比较同一交叉编码器下任意检查点对特征的使用,包括未参与训练的检查点,从而把“训练改变了什么”从输出层面推进到表征层面;特征级干预也提供了一种在不改权重的前提下检验重加权是否承载收益的手段。

结论建立在三个 OPD 设置与一个 Qwen3 预热设置上,作者也说明其关于预热的结论不适用于一般 SFT;特征含义依赖对放电最强 token 的人工解读,决策词类别由作者按反思、犹豫、推进三类划分。重加权之外是否还有其他机制、以及这些发现在更大模型与更多任务上的表现,仍是开放问题。此外,本文档为全文,但部分表格与图注在文本中以占位形式出现,个别数值(如部分百分比与对照数值)在正文中未完整呈现,读者若需精确数字应查阅原文图表。

来源