UniSkill 用对比动作反馈训练技能提议器,在 ALFWorld 达 98.4% 成功率并保持稳定联合训练
核心概要
UniSkill 让共享策略同时充当执行动作的 actor 与提出技能库编辑(Add、Update、No Edit)的提议器,用对比动作反馈衡量替换检索技能后当前 actor 在成功与失败轨迹上的动作对数似然差变化,从而无需为每个提议额外 rollout 即可训练提议器,并配合技能编辑支持正则化保持探索;在 ALFWorld 达 98.4% 成功率、WebShop 达 84.7% 成功率,且 250 步联合训练保持稳定。
Figure 1: ALFWorld training dynamics. (a) UniSkill continues improving later in training, whereas Evolving-RL collapses after strong early gains. (b) The learned skillbank grows rapidly early and continues evolving through occasional additions and updates (non-overlapping 10-step means).
arXiv深度剖析
提出 UniSkill 共享策略框架,同一策略既作为 actor 依检索技能生成环境动作,又作为技能提议器从已完成轨迹生成结构化技能编辑提议(Add、Update、No Edit),并引入技能编辑支持正则化以维持对编辑操作的探索。 相较以往用固定参数 LLM 抽取技能、或仅用任务结果预测准确率与轨迹奖励训练提议器的方法,这里把 actor 与提议器放在同一策略下联合学习,并显式处理提议级反馈对编辑操作的抑制问题。 方法在 Section 3 给出完整目标函数与正则化定义,并在 Section 5 的 Q3 中对比有/无支持正则化的技能编辑分布与验证曲线:无正则化时坍缩到单一操作,有正则化时三种操作持续被采样且后期成功率更高。
提出对比动作反馈:在策略更新前固定当前 actor 与已记录行为,只改变条件技能,测量替换检索技能后成功与失败参考轨迹之间动作对数似然差的变化,作为 actor 对齐信号。 相较 Evolving-RL 需为每个候选技能做额外技能条件 rollout 来评估,这里复用已收集轨迹,避免逐提议的额外 rollout,降低技能评估开销。 Section 3.3 给出似然与对齐奖励定义;Section 5 的 Q2 在训练步 25 与 75 各随机抽取 100 个合格提议,每个条件 32 次 rollout,报告对齐分数与成功率增益呈正 Spearman 相关,但仍有 24.5% 与 15.6% 的正分提议出现负增益。
在 ALFWorld 与 WebShop 上取得较强表现:ALFWorld 成功率 98.4%、WebShop 任务分 90.5 且成功率 84.7%,并在 250 步联合训练中保持稳定,验证成功率整体上升。 相较 RL-only 基线,ALFWorld 成功率比 GRPO 高 20.8 个百分点、比 GiGPO 高 7.6 个百分点;相较技能增强 RL,WebShop 成功率比 SkillRL 高 12.0 个百分点;相较同为联合训练的 Evolving-RL,ALFWorld 成功率高 5.4 个百分点,且 Evolving-RL 在延长训练后出现性能崩溃。 Table 1 报告主结果,ALFWorld 主结果与分布外结果均为三次独立训练运行的均值与样本标准差;基线在统一协议下取自先前工作或复现。
消融显示联合训练与 actor 对齐反馈各自有贡献:去掉对齐奖励的变体在无检索评估下为 84.4%,而完整 UniSkill 为 96.1%;仅训练提议器为 34.4%。 该对比在相同联合训练流程与技能库更新规则下只改变是否将对齐奖励纳入提议器目标,从而把 actor 无检索性能的提升归因于 actor 对齐反馈这一训练信号。 Table 2 列出四种设置的 ALFWorld 成功率(有/无检索),所有变体均从空技能库开始并保留训练期技能检索,critic 检查与技能库更新规则一致。
启示与展望
该工作面向文本多轮交互任务:ALFWorld 的 household 导航与物体操作、WebShop 的模拟电商搜索与购买,评估使用官方 valid_seen 主结果与 valid_unseen 分布外结果,且不涉及真实物理动作或真实购买。方法适用于维护技能库并需要为技能提议分配信用的联合训练场景,尤其是希望避免逐提议环境 rollout 开销的团队;共享策略在 3B 骨干下仍报告有效,说明该机制不依赖单一模型规模。对读者而言,可直接复用的是对比动作反馈这一评估思路与技能编辑支持正则化这一探索保持手段,实现已在论文中给出链接。
对齐分数在聚合层面与 rollout 增益正相关,但在训练步 25 与 75 分别有 24.5% 与 15.6% 的正分提议出现负增益,因此它是有信息量的代理而非逐提议保证;案例研究进一步区分了额外要求导致被排除、actor 未一致遵循合理新技能、以及提议本身遗漏放置先于搜索的次序约束三类不一致来源。技能库准入要求同时满足 critic 检查与对齐阈值,这一更严格准则会排除部分正分提议。此外,技能库增长在训练早期较快、随后因被接受的 Add 变少而放缓,长期演化行为在文中主要覆盖 250 步训练范围。
