跳到主要内容
返回时间线
arXiv来源发表:

把“教师自身漂移”从蒸馏信号里剥离:Cal-OPD 的校准式在线蒸馏

核心概要

该工作指出在线蒸馏(OPD)所用的教师—学生逐词差异中混入了教师自身的上下文诱导漂移(Teacher Self-Deviation, TSD),并提出 Cal-OPD:用正负特权干预估计教师的自我漂移区间,只保留超出该区间的残差作为优化信号,在数学推理基准上仅保留约 52–65% 的原始差异却稳定优于标准 OPD 及其多种变体。

深度剖析

识别并刻画了“教师自我漂移”(TSD):在固定问题、固定学生 rollout、固定被评估 token 的前提下,仅改变教师侧上下文,教师对同一 token 的对数似然仍会显著变化。 以往工作把教师似然当作逐 token 等可靠参考,或从不确定性、位置、结果、轨迹质量等角度讨论监督可靠性;这里把“受控上下文干预下教师似然的变化”显式建模为一个可估计的漂移区间。 以 Qwen3-1.7B 为学生、Qwen3-8B 为教师,在 DAPO-17k 采样的 6,528 个问题上生成 rollout,约 6,000 万响应 token 在基线加八种上下文干预下重新打分;并跨阈值与教师规模(Qwen3-4B-Thinking-2507)复现。

TSD 在缺乏任务知识时就已大量出现,且对干预语义与正确性不敏感,主要集中于表层语言标记而非数学内容 token。 说明教师似然偏移不能可靠地解读为任务知识信号,且更丰富的特权上下文主要是“扩大”已受影响的 token 位置,而非从零制造新的漂移模式。 任务无关指令下显著 TSD 的并集覆盖率与评估反馈、答案级特权相当;正负变体在位置重叠、方向一致性与共享偏差比例上高度一致;最高 TSD 率 token 为 maybe、however、therefore 等,最低为数字与数学符号,形成近一个数量级的分离。

提出 Cal-OPD:用正负特权干预估计教师自我漂移区间,把被该区间覆盖的教师—学生差异置零,只保留超出边界的残差作为 token 级优势。 特权信息不再直接蒸馏给学生,而是用于“校准教师参考”;这与 Privileged-OPD 直接把特权教师输出蒸馏给学生形成对照。 给出显式分解与松弛因子 ε 的区间估计公式,并在两种教师—学生规模(4B→1.7B、30B-A3B→4B)与六个数学推理基准上以 Avg@16 评估。

在数学推理基准上,Cal-OPD 仅保留约 52–65% 的原始教师—学生差异,却在两种规模配置下取得最高平均成绩,并缓解标准与特权 OPD 的响应长度膨胀。 标准 OPD 在 4B→1.7B 上仅小幅提升、在 30B-A3B→4B 上甚至低于学生;Privileged-OPD 在两种配置下平均表现最低。保留更少信号反而更好,说明“学得更多差异”并非关键。 两种配置下 Cal-OPD 平均分最高,12 个基准—配置组合中 7 个最优;消融显示评估反馈干预最优,解级特权干预过度过滤导致平均分下降;保留比例匹配的对照(Advantage-Sync、Token-Sync、TSD-Filter)均未复现其增益。

启示与展望

该结果面向使用在线蒸馏做推理后训练的研究与工程场景:教师与学生来自同一模型家族、任务为数学推理、评估为 Avg@16 准确率,且校准依赖可构造的正负特权干预(如评估反馈、答案级或解级特权)。它支持的做法是:把特权信息用于估计教师自我漂移区间并只蒸馏残差,而不是把特权教师输出直接教给学生;在教师—学生规模差距中等时,还可能因避免响应长度膨胀而缩短总训练时间。

校准区间的估计依赖所选取的正负干预:评估反馈干预表现最好,解级特权干预会过度过滤并导致信号塌缩,因此干预选择本身是需要继续探索的设计维度。松弛因子 ε 的最优值(文中为 5)与保留比例的关系、以及在不同教师规模与任务上的稳定性,仍是开放问题。此外,本文为全文解析,但部分图表与附录细节以文字描述形式呈现,若需复现具体数值与曲线,仍应回到原文核对。

来源