跳到主要内容
返回时间线
arXiv来源发表:

8 条真实提示词即可媲美 1.7 万题:无数据在线策略蒸馏用 64 个自生成问题达到全量数据水平

核心概要

该工作在两个单教师在线策略蒸馏(OPD)设置中发现,仅用 8 条真实提示词训练即可达到用 1.7 万个问题训练的效果,且难度与初始蒸馏差距差异很大的数据集结果相近;据此提出无数据在线策略蒸馏(DF-OPD)设置,用 64 个无种子示例的自生成问题即可媲美全量数据 OPD,并在多教师 OPD 中(数学、代码、指令跟随)用 1k 生成问题达到约 7k 真实后训练样本的水平。

Source-provided article image: Data-Free On-Policy Distillation: How Far Can We Go Without External Data?
Figure 1 ·

Figure 1: Reducing dependence on training questions. (a) OPD uses external questions. (b) DF-OPD uses teacher-generated questions. (c) Empty prompts work only in some tested settings; success is associated with student self-questioning and answering (implicit DF-OPD). OPD arrows denote token-level teacher supervision on student-generated trajectories.

arXiv

深度剖析

在线策略蒸馏对训练问题的数量依赖远低于预期:在两个代表性单教师 OPD 设置中,用 8 条真实提示词训练的性能与用 1.7 万个问题训练相当。 此前该方向的工作主要关注算法改进,训练问题本身的作用未被系统刻画;该工作把“训练数据量”作为独立变量加以检验,给出可比较的对照结果。 证据来自两个单教师 OPD 设置下的对照实验,比较对象为 8 条真实提示词与 1.7 万个问题;原文以“performance comparable”描述结果,未给出具体指标数值。

数据集难度与初始蒸馏差距的差异对结果影响有限:在测得的难度和初始蒸馏差距上差异很大的数据集,得到的结果相近。 把“数据难度/初始差距”这一常被假设为关键的因素纳入检验,说明 OPD 的效果并不主要由这些数据集属性决定。 基于对数据集难度与初始蒸馏差距的测量与对比;原文未报告具体测量数值或统计检验。

作者提出两种互补解释:重复采样可能让少量提示词就暴露出大量教师监督信号;同时 OPD 迁移的是可泛化的推理能力,而非数据集特有的知识。 为“少量数据为何够用”提供了机制层面的候选解释,把观察结果与采样次数、能力迁移两个角度联系起来。 原文表述为“Our analyses suggest”,属于基于实验观察的分析性解释,而非直接因果验证。

提出无数据在线策略蒸馏(DF-OPD)设置:无需种子示例,用 64 个自生成问题即可在两个单教师设置中媲美全量数据 OPD;在多教师 OPD 中,跨数学、代码、指令跟随,1k 生成问题达到约 7k 真实后训练样本的水平。 把“减少数据依赖”推进到“完全不需要外部数据”,并验证该设置可扩展到多教师、多任务场景。 证据为单教师与多教师两类设置下的对比实验;多教师覆盖数学、代码、指令跟随三个领域,比较基准为约 7k 真实后训练样本。

启示与展望

该结果面向采用在线策略蒸馏进行后训练的研究与工程场景,尤其是单教师与多教师两类设置;它说明在数学、代码、指令跟随等任务上,训练问题可以被大幅削减甚至由系统自生成。对希望降低数据准备成本、或难以获得高质量外部数据的团队,这提供了以自生成问题替代外部数据的可行路径。原文还探索了完全不含显式训练问题的情况,但该情形仅在有限条件下有效,即学生模型意外地自行生成并回答自己的问题,从而退化为隐式形式的 DF-OPD。

原文以“comparable”描述多处关键对比,未给出具体指标数值、评测基准细节与统计显著性,因此“相当”的幅度与稳定性仍需读者结合代码与后续实验判断。两种解释(重复采样暴露教师监督、OPD 迁移可泛化推理能力)属于分析性推测,尚未被直接验证。完全无显式训练问题的情形仅在有限条件下有效,其触发条件与可复现性仍是开放问题。此外,本次读取为摘要级范围,未包含图表与完整实验细节,上述数值与设置的具体实现方式需查阅原文与代码确认。

来源