DuoOPD 用师生联合结果改写蒸馏反馈:Qwen3 宏观准确率较 OPD 提升 2.58 个百分点,Llama 提升 5.98 个百分点
核心概要
该工作提出 DuoOPD,一种多任务在线策略蒸馏方法:由学生自身的验证结果决定反馈方向,由教师与学生的联合结果决定教师如何提供支持——仅教师成功时把其已验证答案作为评分上下文,仅学生成功时用任务内共享权重强化整段回答,一条规则覆盖四种结果组合且无需任务特定设置;在 Qwen3 与 Llama 上,DuoOPD 在平均宏观准确率上超过全部五个基线,较 OPD 分别提升 2.58 和 5.98 个百分点,并在科学计算、指令遵循与代码生成等另外两个任务混合上同样领先。
深度剖析
论文指出在线策略蒸馏(OPD)忽略正确性结果,因而会压低学生本已答对的回答:在 DuoOPD 的训练响应上,原始上下文的师生对数比即使在学生正确时平均也为负,而正确响应占训练响应的 64–69%。 此前 OPDVR 一类方法只用学生正确性约束反馈方向,但无论教师是否成功都以同样方式使用教师;DuoOPD 把教师结果也纳入决策,用联合结果选择教师的评分上下文与权重分配。 论文报告了 Qwen3 与 Llama 上师生四种正确性组合在任务相关比例下的分布,例如 Llama 学生在教师失败处成功的比例为生物 5.9%、物理 9.8%,并给出训练响应上对数比与门控权重的均值统计。
DuoOPD 用一条四结果规则统一处理多任务蒸馏:仅教师成功时把教师已验证答案加入教师上下文以指导纠错,仅学生成功时给该任务内所有有效 token 一个共享正权重,两者都成功或都失败时由教师偏好决定强化或抑制的强度。 该规则以每条响应的结果而非任务为条件,因此不需要任务特定设置;权重共享按任务而非全局进行,因为各任务的对数比尺度不同(生物、化学、物理的每任务共享权重平均 0.56–0.57,另两个混合中为 0.56–0.64 与 0.57–0.64)。 消融显示去掉教师参考使宏观准确率下降 1.49 个百分点,去掉权重共享下降 0.71 个百分点,两者同时去掉下降 2.41 个百分点至 64.56%,接近 OPDVR 的 64.83%;任务内共享在三个混合上均优于跨任务共享。
在生物、化学、物理任务上,DuoOPD 在 Qwen3 与 Llama 两个模型家族上均领先全部五个基线,平均宏观准确率较 OPD 提升 2.58 与 5.98 个百分点,并超过最强基线 EOPD(Qwen3)与 OPDVR(Llama)1.16 与 4.58 个百分点。 增益同时出现在教师能解和教师失败的问题上(Qwen3 分别 +1.90 与 +0.67,Llama 分别 +3.86 与 +2.12),说明学生既学到更多教师已知内容,也在教师之外取得更多成功。 结果基于每个方法三次训练运行,报告了标准差;评估对每个测试问题采样八个回答并报告 avg@8,宏观值为三个任务的等权平均。
在两个更异质的任务混合上 DuoOPD 同样领先:科学知识、理解与计算混合达到 63.48% 宏观准确率,高于最强基线 ExOPD 0.86 个百分点;物理、指令遵循与代码生成混合达到 49.24%,高于 OPDVR 1.41 个百分点,并在每个任务上得分最高。 论文还报告 DuoOPD 在每个设置中最难任务上取得最高准确率(物理 62.10 与 69.02、物理计算 43.33、MBPP 32.69),且未使用显式的最差任务目标。 两个附加混合各用 Qwen3 配对单独训练,任务仅通过各自的验证器进入;指令遵循使用官方 IFEval 的提示级严格评分,代码使用 MBPP 原始断言在隔离进程中执行。
启示与展望
该结果面向拥有二元验证器、且教师与学生共享分词器的多任务蒸馏场景:论文在生物、化学、物理知识,材料知识、化学理解、物理计算,以及物理、指令遵循、代码生成三类混合上验证,教师与学生配对为 Qwen3-4B 到 Qwen3-0.6B、Llama-3.1-8B-Instruct 到 Llama-3.2-3B-Instruct。方法需要预先缓存并验证每个训练问题的一条教师回答,论文报告该一次性缓存占一次 OPD 训练循环 GPU 时间的 30%(Qwen)与 23%(Llama),若缓存可跨学生、种子与超参数复用,则训练循环加缓存的额外开销降至 +9.2% 与 +15.0%。论文指出该规则可与任务级方法组合:验证器可验证任务特定教师,任务权重可缩放 DuoOPD 的每任务反馈,联合结果也可为任务调度提供信号。
论文自身列出若干开放问题:方法依赖二元验证器,写作等开放式任务需要能处理分级或不确定判断的反馈规则;教师计算可通过共享缓存、压缩参考与选择性使用参考进一步降低;更长的推理轨迹下探索与自我纠正值得研究;每个混合都在相同任务上训练与评估,联合结果指导能否迁移到留出任务、任务级结果统计能否指导任务调度,仍待回答。此外,本次读取为全文,但表格与图以文本形式呈现,个别数值(如部分对数比与权重均值)在文本中未完整给出,读者若需精确数值应查阅原文表格与附录。
