X-Tree 把轨迹中的可复用技能挖成树,在 WebArena、ScienceWorld、WebShop 上以同等数据与预算把成功率最多提高 4.5%、5.8% 和 4.1%
核心概要
该工作提出 X-Tree:先用规范化把每个动作变成 typed token(如 type⟨date⟩、click⟨button⟩),再用 X-Score(按复现频率、跨度长度、出现在成功回合中的比例打分)递归合并相邻动作对,从轨迹池中确定性地挖出一棵可复用经验树,全程零 LLM 调用;随后把 X-Tree 接入三种训练方式——离线 RL(每个节点作为一个训练实例,用步匹配奖励加深度缩放完成奖励)、在线 RLVR(自适应技能奖励,验证器信号稀缺时给分、变密时退火)、以及 on-policy 自蒸馏(把 X-Tree 渲染成自教师的特权上下文,替代 LLM 编写的技能库);在 WebArena、ScienceWorld、WebSho
深度剖析
X-Tree 把轨迹语料压缩成一棵确定性的、可审计的技能层级树,每个内部节点表示一个频繁且与成功相关的技能如何由子技能组合而成。 此前利用层级结构的 agent 做法是把 LLM 写出的自然语言技能放在上下文里检索复用,技能从不进入权重;X-Tree 改为从数据本身用计数式合并恢复层级,零 LLM 调用。 论文给出挖掘流程与超参(WebArena 从 7,974 条轨迹挖 256 个技能,ScienceWorld 从 1,673 条挖 80 个,WebShop 从 1,824 条挖 48 个),并给出真实节点案例,例如 WebArena 中“填两个字段并提交”的深度 2 节点在语料中出现 411 次,既出现在后台日期筛选也出现在地图路线查询。
在只有轨迹、没有环境的离线 RL 中,把每个 X-Tree 节点当作一个训练实例,用步匹配奖励加深度缩放完成奖励,可在同等预算下超过全量 SFT。 标准 SFT 与 RLVR 把动作流当作扁平序列、对每个 token 等权;该工作改为在节点粒度上给信用,并让完成奖励随深度增长。 WebArena 694 个确定性任务上,X-Tree 全配方达到 22.9 SR,对照 Go-Browse SFT-Full 为 18.4;把 RL 计算量对齐(多跑两个 SFT epoch)只把 SFT-Full 提到 18.8,说明增益不是来自算力;消融显示整条轨迹(19.9)、随机跨度(19.5)、随机树(17.9)、二值结果奖励(18.2)都低于 X-Tree。
在在线 RLVR 中,X-Tree 提供自适应技能奖励:当一组 rollout 全部失败、结果奖励无法区分时给出对比信号,随成功率上升而退火。 与学习出来的过程奖励模型不同,这个塑形信号直接从轨迹池中挖出,并按组内胜率动态调权。 ScienceWorld 上各规模均领先 outcome-only GRPO,最多 5.8% SR,在未见任务 G2 折上每个规模都领先、最多 5.8% SR;WebShop 上 success 最多提升 4.1%、graded score 最多提升 4.1%;按 rollout 规模 2/4/8/16 分组测试显示,增益在 rollout 数小、结果信号稀疏时最大,在 rollout 数大时收窄。
在 on-policy 自蒸馏中,把 X-Tree 渲染成自教师的特权上下文,可以替代 LLM 编写的技能库,且不产生 LLM 调用成本。 OPSD 原本依赖 LLM 写出的技能库作为特权上下文,该工作用确定性挖掘并固定模板渲染的 X-Tree 替换它,教师与学生只差上下文,因此差距可归因于上下文本身。 ScienceWorld 与 WebShop 两个环境、三个规模、多个泛化层级上,渲染后的 X-Tree 与 LLM 编写的技能库(ScienceWorld 用 gpt-oss-120b,WebShop 用 GPT-o3)表现相当,在多数运行中领先,最多领先 ScienceWorld 与 WebShop 各若干点;消融显示空特权上下文回到 outcome-only 水平,打乱 X-Tree 词序会掉分。
启示与展望
这项工作面向的是已有轨迹池、但环境或验证器稀缺的多步 agent 训练场景:离线 RL 接入适用于只有轨迹、无法执行动作的域(如 WebArena 的 694 个确定性任务),在线 RLVR 接入适用于有环境与验证器的域(ScienceWorld、WebShop),OPSD 接入适用于已有自蒸馏训练器、需要替换技能库的域。它使研究者可以在同等数据与预算下把同一批轨迹用得更充分,也让技能库可以完全从数据复现而不必调用 LLM;论文还指出 X-Tree 会标出语料中哪些位置稀薄,从而提示值得合成哪些轨迹。
X-Tree 只从固定轨迹池挖一次,训练过程中不再更新,论文把“从策略自身轨迹挖掘、让结构与策略共同改进”列为未来方向;三种接入各自只在一个设置中验证,从未组合使用,因此组合后的效果仍是开放问题;OPSD 的增益依赖基座模型能否读懂并遵循技能文本,论文观察到 7B 时增益更大、1.5B 与 3B 时只有几个点;此外本次加载的是论文正文与附录,部分表格中的具体数值在文本中以占位形式出现,若需要逐格核对均值与标准差,应回到原文表格。
