北大等团队用单字回答蒸馏出编码能力:Qwen2.5-1.5B学生模型在HumanEval+上比严格对照高5.34个百分点
核心概要
该工作提出主动无任务蒸馏(ATD),用公共祖先模型挑选它对两个普通单词几乎无偏好的无关提示,只让私有的后训练教师模型对每个提示返回一个单词,再用这些提示-单词对训练同源学生模型;在Qwen2.5-1.5B主实验中,5,664条单字回答使学生在HumanEval+上比严格匹配的干扰对照高出5.34个百分点,并在科学知识、常识推理和阅读理解等任务以及不同模型代际、规模和家族上观察到正向平均增益。
深度剖析
ATD把后训练更新在无关输入上的行为变化当作可观测对象,用公共祖先模型筛选出它对两个普通单词几乎等概率的提示,再让教师模型对每个提示只返回一个词,学生仅凭这些提示-单词对学习。 此前的阈下学习工作主要传递的是特质或偏好,且依赖大量教师输出;该工作把观测压缩到每个提示一个单词,并首次报告能力层面的传递。 主实验使用Qwen2.5-1.5B-Instruct作为公共祖先与学生初始化,教师为冻结的rank-16代码DPO LoRA;5,664条单字回答构成全部训练信号,冻结审计确认其中不含代码、数学、基准或任务词。
在编码主实验中,学生达到与教师总体编码得分相当的水平,并超过全部对照:比严格干扰匹配置换高5.34个百分点,比全局教师标签打乱高5.03个百分点,比无教师公共标签对照高4.57个百分点。 严格对照保持与信号相同的完成词多重集和每档翻转次数,只破坏提示与教师单词的对应关系,因此增益不能由词频或标签边缘分布解释。 HumanEval+通过执行按贪心pass@1评分,学生无法靠模仿载体词伪造;区间为对配对的任务级信号减对照差异做bootstrap,跨训练种子与任务重采样。
效应在重新构造采集集、重新训练教师以及不同适配方式下持续存在:五个独立采集集各配自己的教师与严格对照,交叉三个训练种子,聚合效应为+4.80个百分点,15/15与5/5均为正;LoRA r16、r32、r64与全参数SFT四种设置下学生均超过各自的严格干扰匹配对照。 主结果不再只依赖学生优化种子的变化,而是同时重采样采集集、教师与训练种子。 聚合区间为三轴交叉bootstrap,采集集间标准差为0.9个百分点;各适配设置的信号减对照差分别为+5.34、+6.55、+9.15与+4.67个百分点。
传递具有来源特异性与可组合性:三个来源与三个目标端点的交叉中,每个影子在匹配目标上效应最大,非对角效应接近零或为负;数学与代码影子的50/50混合可同时恢复两个来源,恢复方向随教师更新强度单调变化。 通道并非通用的“训练更充分”方向,而是携带与来源能力相关的信息,且多个来源可以叠加。 来源特异性来自三来源三端点矩阵;混合实验显示数学与代码对齐优势分别为+0.046与+0.062,各在3/3种子上为正;强度分级在代码与SciQ两条轨迹上Spearman均为1.0。
启示与展望
该结果适用于已知公共祖先的设置:教师由该公共模型私有后训练得到,学生从同一祖先初始化,教师只通过黑盒接口对每个查询返回一个贪心token,查询集必须在看到任何教师响应前固定。它面向研究后训练更新可观测性与隐式蒸馏的研究者,也面向需要评估私有适配是否通过无关行为泄露信息的服务方。载体由公共祖先在无教师信息的情况下筛选,编码主实验的5,664条训练行经冻结审计确认不含代码、数学、基准或任务词,因此该工具可用于在无目标任务样本、无教师logits、无教师参数的条件下检验能力传递。
传递并非在所有测试设置中都可靠:附录H报告在不兼容祖先下未观察到传递,在教师自身增益很小的MBPP+端点上恢复效应接近零,作者将其解释为通道带宽有限。作者也指出,当前方法依赖主动构造的载体与已知公共祖先,尚不清楚是所选观测携带的能力信息太少,还是学习过程未能充分利用这些信息。多token观测在算术端点上效应较大,在非算术端点上虽符号一致但幅度接近零,区间在该规模下接近零。此外,本文档为完整正文,但部分表格与图示以文本形式呈现,个别数值的排版在加载文本中不完整,读者若需精确复现应查阅原文表格。
