跳到主要内容
返回时间线
arXiv来源发表:

PivotOPD 把蒸馏集中在关键失误及其后几轮,让 Qwen3-1.7B 在 ALFWorld 上比最强基线高 5.5 个百分点

核心概要

该工作分析 ALFWorld 上 Qwen3 系列(8B–235B)的失败轨迹,发现过半失败含有一个早期且通常可恢复的“关键失误”,据此提出 PivotOPD:用教师模型定位关键轮并给出金动作与后续恢复动作,以反向 KL 做预防蒸馏、以正向 KL 做恢复蒸馏,与组相对 RL 合并进一次 PPO 更新,在 ALFWorld、WebShop、Search-based QA 上对 Qwen3-1.7B 与 Qwen3-8B 均取得最高平均表现,并把增益迁移到 Nemotron-3.5 在 SWE-Bench Verified 上的解决率(+3.2%)。

AI-generated editorial illustration: PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents

深度剖析

失败往往由单个早期关键失误决定,而且这个失误通常还能救回来。 此前多轮 OPD 方法主要靠重加权轮次或限制蒸馏轮次来缓解误差累积,但没有回答失败是否系于单个决定性失误、以及学生能否从该状态恢复;该工作用 ALFWorld 的符号 oracle 逐轮重算剩余最优轨迹长度,把“使剩余最优轨迹变长或使任务不可解”的动作定义为关键失误,并给出反事实重放证据。 在 Qwen3-8B、Qwen3-30B-A3B、Qwen3-235B-A22B 三个模型的失败轨迹中,含关键失误的比例分别为 62%、57%、56%,合计 58%;关键失误首次出现的中位轮次较早,之后三个模型平均浪费 6–9 轮未恢复;对 Qwen3-8B 的反事实重放中,纠正首个关键轮把重放成功率从 22% 提到 74%,保留失误但在其后两轮强制 oracle 动作仍达 71%(三轮约再加 4 个百分点),重放能复现记录结果,因此反事实是精确的。

标准 on-policy distillation 修不好关键轮,因为学生几乎采不到恢复动作。 该工作把“OPD 在关键轮失效”从直觉变成可测量的诊断:不仅看总体失败率,还把失败拆成“关键轮之后失败”与“无关键轮失败”两类,并直接测量冻结策略在关键轮上给 oracle 动作的概率。 Qwen3-8B 用标准 OPD 训练后,留出任务总体失败率从 78% 降到 62%,但关键轮之后的失败率只从 74% 降到 69%,大部分收益来自无关键轮的失败(从 4% 降到 2%);蒸馏把已犯错误的中位概率从 0.90 压到 0.01 以下,把 oracle 动作的中位概率提高十个数量级,但在每个被评估的关键轮上仍低于 0.01,因此一组 8 条 rollout 期望上采不到它。

把稠密监督集中到关键轮及其后几轮,并显式训练“恢复”动作,比只做预防更有效。 PivotOPD 用教师模型在事后读轨迹、选出候选轮并命名金动作,以“学生实际动作与金动作不一致”判定关键轮;预防蒸馏用反向 KL 在已采样响应上把学生推离已犯错误,恢复蒸馏用正向 KL 在自教师写出的响应上抬高学生极少采样的恢复动作概率,两者与组相对 RL 合并进一次 PPO 更新。 在 ALFWorld 上,至少一个教师检测到的关键轮落在 oracle 标注关键轮前后一轮内的比例为 62%,至少是随机选轮基线的两倍;组件消融中完整方法平均成功率 73.7%,仅预防 72.5%、仅恢复 64.7%、随机轮注入提示 62.6%、用通用反思提示替换金动作 71.9%(Pick2 上下降 9.3 个百分点);恢复预算消融显示所选预算在 ALFWorld 上把最佳验证分数提高 1.2 分、WebShop 提高 1.2 分、Search-based QA 提高 0.9 分。

增益在多个基准、两种学生规模、以及另一个模型家族与软件工程域上都能复现。 相对 13 个基线(含 GRPO、OPSD、RLSD、SDAR、TurnOPD、TCOD、SOD、StepOPSD、AgentOPSD、Skill-GRPO、OPID、Skill-SD、PivotRL),PivotOPD 在三个主基准的八个分项平均上均排第一,并在自蒸馏(学生当自己的教师)设置下仍居首,说明收益更多来自“在哪里、如何干预”而非教师容量。 Qwen3-1.7B 学生在 ALFWorld 上比最强基线高 5.5 个百分点(73.7 对 68.2),Search-based QA 高 5.9 个百分点(44.5 对 38.6);Qwen3-8B 学生 ALFWorld 93.0、Search-based QA 47.4、WebShop 分数 88.2 与成功率 81.9,均领先且优势至少 1.4 个百分点;WebShop 上 1.7B 学生相对 RLSD 分数只高 1.2 但成功率高 14.1 个百分点;自蒸馏下三个基准均领先最强基线至少 1.0 个百分点;Nemotron-3.5-SFT 在 SWE-Bench Verified 上解决率提高 3.2%,而标准 OPD 只提高 0.4%,约补上到教师差距的三分之一。

启示与展望

该结果面向多轮、可重放环境的语言智能体训练:ALFWorld、WebShop、Search-based QA 都能精确复现记录观测,因此恢复预算可以取到 3;SWE-Bench Verified 上因审计轮是最后一个已提交动作,恢复预算取 0,只加了预防蒸馏。适用对象是使用组相对 RL 加教师蒸馏的团队,尤其是成功 rollout 稀少、组内优势恒为零的任务类型。诊断部分依赖 ALFWorld 的符号 oracle,其他基准上关键轮位置只能由教师模型估计。推理阶段学生不需要教师、提示或恢复,因此不增加测试时计算;训练阶段增加自教师前向与恢复 rollout,ALFWorld 上恢复轮从 1 增到 3 时这部分耗时增长超过十倍。

关键失误的比例与可恢复性是在 ALFWorld 上用符号 oracle 测得的,其他基准只有教师估计,因此这一结构在更开放环境中的普遍程度仍是开放问题。教师命名错误会直接变成错误的蒸馏目标:ALFWorld 上教师检测与 oracle 在一轮内一致的比例为 62%,其余情形监督落在别处;学生自任教师时方法仍最好,但 ALFWorld 成功率低于使用更强教师。恢复预算与恢复权重相互影响、需按基准在验证集上扫描,迁移到新基准需要重新调参。所有智能体的历史窗口最多五轮,关键失误后浪费的轮次是在该窗口下统计的,其中一部分可能来自历史长度限制。此外,本次读取的文本中部分数值在正文与摘要处被排版吞掉,表格与图注中的个别数字无法从文本直接核对,涉及这些位置的结论应以原文图表为准。

来源