ActFirst-OPD 让多轮智能体先行动后推理,在 ALFWorld、WebShop、ScienceWorld 上把同策略蒸馏训练提速 2.3、1.8、4.9 倍
核心概要
该工作提出 ActFirst-OPD,把环境交互与完整响应生成解耦:学生模型借助参考下一观测做参考条件逆动力学推断并执行动作,一旦转移偏离参考轨迹就切换为自主下一动作预测,同时从收集到的交互上下文异步生成完整“先思考后行动”响应供教师做 token 级监督;在 0.6B、1.7B、4B 的 Qwen3 学生上,相对 Vanilla OPD 在 ALFWorld、WebShop、ScienceWorld 取得平均 2.3 倍、1.8 倍、4.9 倍的墙钟训练加速,并在九个基准–模型设置中的八个里平均任务成功率持平或更高。
深度剖析
论文识别并刻画了多轮同策略蒸馏中的“推理阻塞环境转移”瓶颈:标准先思考后行动 rollout 在每次提交短动作前都要完成长推理,从而拖慢环境转移与经验收集。 此前多轮 OPD 工作(如 TCOD 用时间课程缓解轨迹级 KL 不稳定、TurnOPD 结合自适应 rollout 深度与轮级损失加权)主要处理监督质量与稳定性,而本文把在线经验收集本身的延迟作为独立问题提出。 作者对 Qwen3-1.7B 在 ALFWorld 上的剖析显示推理占每轮 rollout 时间的 81–95%,并给出受控对比:直接生成动作的 rollout 出现更多无产出重复、每 100 次环境转移的成功轨迹更少。
论文提出 ActFirst-OPD 框架,用参考条件逆动力学加自主下一动作预测回退来生成快速动作,并把完整响应生成异步化,从而把推理移出环境转移的关键路径。 该方法把 RIDM 式“由当前观测与专家下一观测推断动作”的条件方案迁移到多轮 OPD,并新增偏离后的自主下一动作预测回退,以及不依赖参考下一观测的异步完整响应生成。 论文给出理想化 rollout 加速的推导与上界(命题 1),并在附录中分析有限并发约束;消融显示去掉逆动力学后平均成功率在 ALFWorld、WebShop、ScienceWorld 分别下降 17.31、1.00、3.04 个百分点,去掉回退分别下降 1.05、3.11、2.82 个百分点。
在三个基准与三种学生规模上,ActFirst-OPD 相对 Vanilla OPD 取得平均墙钟训练加速,并在多数设置中平均成功率持平或更高。 与 Vanilla OPD、TCOD-F2B、TurnOPD 相比,该方法在九个基准–模型设置中的八个里平均成功率持平或超过 Vanilla OPD,并在 ALFWorld 与 ScienceWorld 的三种学生规模上都取得所比较 OPD 方法中最高的平均成功率。 ALFWorld 上相对 Vanilla OPD 的成功率增益为 0.6B、1.7B、4B 分别 8.15、9.85、2.67 个百分点;WebShop 上 Qwen3-1.7B 取得训练加速的同时平均成功率仅下降 1.00 个百分点;训练墙钟时间不含教师训练、参考构建与评测。
论文进一步定位加速来源:既来自更高的环境转移吞吐,也来自更少的环境转移次数,并显示参考条件交互改善了 rollout 质量。 作者把异步生成带来的吞吐收益与逆动力学带来的任务进展收益分开测量,而不是只报告端到端时间。 在匹配设置下,ActFirst-OPD 把环境转移吞吐从每秒 3.65 提升到 5.68,并在完整训练窗口内执行少 30.45% 的转移(38,616 对 55,525);固定检查点的 rollout 质量对比显示其相对直接动作在每个检查点都降低无产出重复比例、提高每 100 次转移的成功轨迹产出并减少 rollout 轮数。
启示与展望
该结果面向具备高质量离线参考轨迹的多轮文本环境训练场景:ALFWorld、WebShop、ScienceWorld 三个基准,Qwen3-0.6B/1.7B/4B 学生与任务专用 Qwen3-8B 教师,评测时学生使用不含参考信息的标准先思考后行动交互。论文指出参考缓存覆盖全部训练任务且可跨学生规模复用,教师训练与参考构建成本在报告的训练墙钟时间之外,因此对固定任务集与环境可一次性摊销。加速的实现在于足够的服务并发:论文的受控实验显示并发上限从 16 提升到 256 时加速比上升,而在较低并发下两种响应长度都出现低于 1 的加速比,说明收益依赖工作负载与硬件。
论文自身指出,参考下一观测目前仅作为 rollout 引导并在偏离后停用,未来可考虑用参考转移做辅助监督或在偏离后重新对齐;参考轨迹难以获得的设置超出其范围。附录 E 说明,快速 rollout 诱导的交互上下文分布不必与推理时先思考后行动策略诱导的分布一致,因此结果支持该设计在已评测设置中的实用价值,但并未确立推理时的暴露偏差被消除或一致降低。此外,本证据包中的主结果表格(表 1、表 2)多数单元格为空,具体数值主要来自正文叙述、消融表与附录,读者若需逐设置数值应查阅原文表格。
