跳到主要内容
返回时间线
arXiv来源发表:

ExpVoyager 让技能策展器按需导航原始经验,ALFWorld 成功率从 41.4% 提升到 63.7%

核心概要

该工作把 LLM 智能体的技能合成重新表述为对过往经验的动态导航问题,提出 ExpVoyager 框架:技能策展器通过可导航接口在不同视图与分辨率下检索原始轨迹,并用导航状态持续记录已获得的可复用程序性知识与待查问题,从而为冻结的执行器按需生成任务专属技能;在 ALFWorld、WebShop、ScienceWorld 三个基准上,ExpVoyager 在任务成功率与执行步数上均优于无技能基线与既有技能方法,并随经验空间扩大持续获益。

AI-generated editorial illustration: ExpVoyager: Direct Experience Navigation for Dynamic Agent Skill Synthesis

深度剖析

论文把技能合成从“先抽象、后使用”改为“按需导航”:策展器在任务当下主动决定查看哪段经验、以何种分辨率查看,而不是在需求未知前就把经验固化为固定程序性知识。 既有方法(AWM、ReasoningBank、Trace2Skill)在任务需求已知之前就把过往经验抽象为固定技能或记忆;SkillTTA 虽在测试时合成技能,但依赖 top-k 相似度检索。ExpVoyager 把经验访问本身定义为主动决策过程。 论文用两项预备分析支撑这一动机:在 ALFWorld 上构造 80 个经执行验证的 oracle 技能,并从训练集采样 300 条源轨迹做 oracle 知识标注;结果显示即使最好的既有方法也未能保留源经验中大部分 oracle 知识,且既有检索范式在知识层面的召回偏低,扩大 k 带来的召回边际收益被冗余与无关信息抵消、精度快速下降。

ExpVoyager 由两个组件构成:可导航接口把每条轨迹组织为轨迹级视图(动作序列、执行结果、任务元数据)与步骤级视图(观察、记录推理、动作、即时结果),并支持 search_exp 与 inspect_traj 两类操作;导航状态在每轮后更新已策展知识与待查问题,使经验访问与解释相互引导。 相比把整条轨迹当作单一检索单元的做法,该接口让策展器按当前调查所需的分辨率查看证据,并在需要时扩展到完整轨迹上下文;导航状态则把新观察解释为可迁移的程序性关系、仍需在执行时验证的条件,以及下一步要查的问题。 消融实验显示,去掉可导航接口后 ALFWorld 成功率从 63.7% 降至 55.3%,去掉导航状态后降至 58.9%;结合 oracle 知识标注的分析显示,去掉接口会降低知识召回并增加无关知识,去掉状态则因反复访问重复知识而拖慢召回增长。

在三个交互式基准上,ExpVoyager 一致提升下游任务表现并减少执行步数,且在不同策展器—执行器组合下保持有效。 论文报告 ExpVoyager 在 ALFWorld、WebShop、ScienceWorld 上均优于无技能 ReAct 基线与四类经验复用基线,并在表 2 中显示更小的策展器也能提升更大的执行器。 表 1 给出具体数值:执行器为 Qwen3.5-9B 时,ALFWorld 成功率 63.7%(基线 41.4%)、步数 25.9;WebShop 成功率 28.7%、得分 61.2;ScienceWorld 成功率 37.4%、得分 47.0。执行器为 Gemma4-31B 时,ALFWorld 69.6%、WebShop 37.9%、ScienceWorld 55.6%。表 2 中更换策展器后 ALFWorld 成功率进一步达到 71.3% 与 75.9%。

ExpVoyager 在经验空间扩大时持续获益,并能与预构建技能协同、更有效地利用经验访问预算。 在线设定下,经验有限时 ExpVoyager 增益有限甚至可能退化,但随着累积经验变多,基线趋于平台期而 ExpVoyager 继续提升并逐步扩大差距;受控离线设定下,基线随源经验增多而下降,ExpVoyager 则持续改善。与预构建技能结合时,组合变体在多数情况下同时提升任务表现并降低任务时成本。 论文报告在线实验在三种随机任务顺序上取平均;预算对比中,ExpVoyager 在约 20 轮导航内随预算增加而获益,超过约 20–25 轮后性能下降,而迭代式 top-k 检索扩展在可比 token 预算下表现更差、增加预算收益甚微甚至有害。

启示与展望

该结果面向以文本交互环境为主的智能体任务:ALFWorld 家务交互、WebShop 在线购物与 ScienceWorld 科学推理,执行器保持冻结,策展器负责生成 skill.md 形式的任务时指导。默认配置使用 Qwen3.5-9B 同时作为策展器与执行器,导航预算为 20 轮,结果取三次随机运行平均;离线设定使用固定源轨迹池(ALFWorld 1000 条、WebShop 1000 条、ScienceWorld 500 个任务—变体对),在线设定则按任务流顺序累积经验。论文还展示了与 AWM、ReasoningBank、Trace2Skill 等预构建技能组合的用法,即把已有技能作为初始知识、再由 ExpVoyager 导航原始经验做按需细化,这为已有技能库的 harness 系统提供了一条增量升级路径。

论文自身报告了若干尚未闭合的问题:在线设定下经验有限时 ExpVoyager 增益有限甚至可能退化,需要经验积累到一定规模才显现优势;导航预算超过约 20–25 轮后性能下降,说明继续导航可能引入冗余或不太相关的经验。案例研究中的失败案例指出,即使导航阶段识别出正确的顺序约束或前置条件,最终技能仍可能丢失动作顺序、未在执行状态变化后重新检查条件,或无法把前置条件翻译为具体可执行动作序列。此外,预备分析在 ALFWorld 上进行,oracle 技能经执行验证与人工复核,但论文也说明成功结果仍可能来自任务特定捷径;知识保留与检索评估依赖 1–5 分语义匹配与归一化,属于模型辅助的度量。这些都属于范围与开放问题,而非对工作的否定。

来源