跳到主要内容
返回时间线
arXiv来源发表:

浙大团队用Qwen2.5从0.5B到14B做25组同族在线蒸馏,发现峰值能力可由学生规模与教师得分提前预测,弱教师反而教出更强的学生

核心概要

该研究在Qwen2.5(0.5B–14B)数学推理上系统刻画同族在线策略蒸馏(OPD)的缩放性质,发现训练初期存在“有效迁移区”,其中留出准确率随学生初始化的token级反向KL平方根近似线性上升,并拟合出以学生规模、教师规模与教师得分为自变量的幂律,可预测峰值准确率与迁移速率,且每个弱到强配对中学生的峰值都超过其教师本身。

AI-generated editorial illustration: Scaling Properties of Same-Family On-Policy Distillation

深度剖析

OPD训练动态呈现两阶段结构:先是规则的有效迁移区,留出准确率(gold score)随KL坐标近似线性上升,随后进入噪声化的尾部,表现为增益衰减、饱和或回退。 此前对OPD的分析多沿rollout长度、token重叠率等轴展开,或聚焦目标函数设计;这里首次把OPD轨迹按KL坐标索引并系统检验其规则性,25组Vanilla-OPD运行的前30个检查点线性拟合得到R²约0.97、RMSE以准确率计约0.30。 25组教师–学生组合(弱到强、同基座、强到弱),Qwen2.5 0.5B–14B,GSM8K与MATH混合训练集14.8K、测试集6.3K,每轮OPD最多10个epoch(580次更新)并周期性留出评估;作者另给出局部KL几何推导,说明gold score一阶变化、KL二阶变化,因而平方根KL线性化局部迁移。

峰值能力与迁移速率可由学生规模、被截断的教师规模以及教师实测得分联合幂律预测,且峰值学生误差近似正比于教师剩余误差。 与仅按参数量读缩放不同,联合律引入教师实测得分这一协变量;在RL端点网格上两者共线(相关系数约0.99)无法分离,作者用自举链中得分低于规模趋势的OPD产物教师打破共线,使教师指数可识别。 留一规模外推中,联合律把仅规模基线的RMSE从3.43降到1.66(Vanilla-OPD),Delta-OPD从2.47降到0.82;对留出的最大学生与最大教师外推误差在0.7与0.4个准确率点以内;一个未进入拟合的对照实验用3B中间检查点(66.0分)蒸馏7B学生,联合律预测峰值74.1、实测73.8,并正确给出其低于1.5B端点教师(77.5)的排序。

在相同得分下,更小的教师迁移效果更好;教师自身的得分并不能单独定义其监督价值。 这解释了为何0.5B学生在3B教师下峰值40.8%,而在7B、14B教师下反而只有39.0%与37.7%;也解释了1.5B的OPD产物得分53.0%高于0.5B RL专家的39.8%,但其3B学生峰值却低于0.5B专家的直接学生。 峰值律中教师剩余误差的指数约为0.97(Vanilla-OPD)与1.02(Delta-OPD),学生规模指数约0.30与0.34,教师规模指数为负;自举链的五个Vanilla-OPD与三个Delta-OPD单元提供打破共线的证据,所有自举区间不含零。

设计选择显著改变迁移:Delta-OPD在17个共享配对中的15个取得更大的匹配KL局部增益斜率、12个取得更大峰值增益,优势集中在弱到强配对;纯OPD在每一格都优于纯离线蒸馏,而离线冷启动会随能力差距扩大而愈发有害;沿模型族自举弱到强OPD并未优于从最小专家直接迁移。 这与此前在棋类谜题中报告自举弱到强微调可超过单步直接迁移的结果相反,并把“教师得分高”与“教师教得好”在轨迹层面分离开来。 冷启动在0.5B专家教3B、7B、14B学生时分别损失6.6、15.7、19.4分,其中一轮SFT即把14B学生拉低32分且后续OPD未能恢复;纯离线蒸馏在最极端弱到强格中低28.4分,同基座格中差距不足1分;自举链在3B、7B、14B上分别为60.4对61.4、70.0–71.3对72.7、76.8对77.7。

启示与展望

该结果面向在同一模型族内做后训练的研究与工程团队:在Qwen2.5 0.5B–14B、GSM8K与MATH混合数学推理、响应上限2K token、固定SFT与GRPO配方的设定下,峰值准确率与迁移速率可由学生规模、被截断的教师规模与教师实测得分提前估计,迁移范围则表现为近似与规模无关的KL预算(Vanilla-OPD中位数0.30、Delta-OPD 0.29)。这使“在小规模上训练一次RL专家、再跨规模迁移”的流水线具备可预测性,也提示教师规模收益在学生自身规模附近趋于饱和。

证据限于单一模型族、单一数学推理混合、每个配对一次规范运行,评估记录为聚合而非逐提示,因此尚无提示级自举或优化种子区间;作者也指出参数量本身混合了模型、数据与算力规模,幂律应在算力最优设定下解读。迁移速率律在留一规模外推下并不优于原始仿射基线,Delta-OPD端点律仅基于五个观测到的偏离,迁移范围律的Delta-OPD指数不可识别,这些都被作者标为探索性。线性窗口的长度、其后的异质尾部以及拟合系数的幂律形式仍属经验规律而缺少机制解释;rollout长度上限、KL估计量、验证频率与同一步日志约定等配方常数被固定,是否影响结论尚待检验。此外,蒸馏可能传递教师的虚假知识、幻觉、偏见与不安全模式,留出准确率只能提供部分保障。

来源