跳到主要内容
返回时间线
arXiv来源发表:

EVOKE 用同一状态下的多目标排序,把预训练世界知识逼进决策:ALFWorld 未见任务从 60.4% 升到 91.8%

核心概要

EVOKE 是一种后训练方法,它在固定环境状态与交互历史的前提下为同一批候选动作引入替代目标并做对比排序,从而迫使策略调用预训练中已有的动作后果知识;在 ALFWorld、WebShop 与搜索式问答三类任务、三个骨干模型上,它取得最佳平均成绩,ALFWorld 未见游戏成功率由 πboot 的 60.4% 提升到 91.8%,且用更少动作完成。

AI-generated editorial illustration: EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making

深度剖析

论文把 LLM 智能体的可迁移性问题重新表述为“引出”而非“获取”世界知识:数字环境中动作后果大多已在预训练中内化,因此不需要额外的预测目标或独立世界模型。 相对 WALL-E、ITP、MemWM、IWM、PaW、EnvRL 等以预测未来观测或辅助预测信号为核心的世界模型路线,EVOKE 不训练预测器、不做推理期规划,只改变监督信号的组织方式。 依据是论文对相关工作的梳理,以及“From Word to World”关于预训练模型在结构化文本环境中已能预测下一状态的观察;论文自身以探针实验佐证知识已存在。

核心机制是在固定状态与历史下做目标干预:同一状态、同一历史、同一候选动作集合在不同目标下被重新评估,当偏好发生翻转时,仅靠上下文习惯或单目标相关性的策略无法正确排序。 既有策略优化方法(GRPO、各类自蒸馏、ETO、DAgger)主要差异在于训练信号如何计算,EVOKE 关注的是每个被访问状态在“哪些目标下”被监督;目标条件 RL 的通用价值函数、后继特征、HER 与 Hindsight Supervised Learning 共享跨目标经验,而 EVOKE 把目标多样性压缩到单个决策上。 理论动机来自 Richens et al. (2025) 关于跨足够丰富目标集合胜任的智能体必然包含可从其目标条件行为中恢复的世界模型;实现上由 LLM 标注器(Qwen2.5-72B-Instruct)对已执行结果打标签,标签基于真实转移而非预测。

训练用对比排序而非模仿:listwise 项抬高正例集合整体质量,pairwise 项把每个正例与每个竞争者分开,竞争者优先选取策略自己偏好的高概率非正例作为难负例。 与 Positive SFT 使用完全相同的目标上下文、正例与更新次数但只做模仿相比,排序在未见游戏上领先 7.5 个百分点(91.8% 对 84.3%),说明增益不只来自更多目标数据。 消融实验在 Qwen2.5-3B 与 ALFWorld 上进行:Source only(只用原始目标)未见成功率 82.8%,Source replay(重复原始目标数据直到更新次数匹配)85.9%,EVOKE 91.8%;在 20%–100% 的嵌套数据子集上,EVOKE 在全部 15 次配对运行中优于 SFT,用 60% 的状态即超过用全部数据的 SFT。

诊断实验显示预训练骨干已经编码动作后果,EVOKE 的作用是让策略按目标而非按习惯做决定。 线性探针在未做任何 ALFWorld 训练的 Qwen2.5-3B 上即可近乎完美解码“是否持握、是否在指定容器、是否热/干净/凉”等后果;在动作文本导致不同结果的转移上,动作文本探针接近随机,而模型表示仍高于 97.0%,随机权重同架构仅 65.0–68.0%。 在 812 个“同一状态、同一历史、同一动作集合但两个目标正例互斥”的目标对上,πboot 仅解出 19.5%,EVOKE 的习惯性错误占 6.4%,比 Positive SFT 少 4.3 个百分点(95% CI [3.0, 5.6]);未见游戏上 EVOKE 在 20 步内解出 91.0%,其他训练变体最多 80.6%。

启示与展望

该结果面向在数字环境中行动的 LLM 智能体,例如网站、检索与文本化家庭任务;方法假设动作后果大多落在预训练世界知识之内,因此论文明确把物理环境中难以脱离具身经验获得的动力学(如接触与运动)排除在适用范围之外。对希望降低训练成本与推理期规划开销的团队,EVOKE 提供了一条以决策级监督替代预测目标的路径,部署时策略只使用目标、历史与可用动作,不含世界模型模块、推理期规划与标注器。迭代聚合按 DAgger 方式逐轮收集新状态与新错误,使难负例持续对齐当前策略。

需要留意的是,全部消融与诊断分析集中在 Qwen2.5-3B 与 ALFWorld 上,其他骨干与其他环境主要提供主表结果;目标干预依赖 LLM 标注器提出替代目标并判定已执行结果,标注质量对偏好标签的影响在正文中未单独量化。探针实验说明骨干已编码动作后果,但“已编码”与“被用于决策”之间的机制仍有进一步刻画的空间。此外,目标对上的联合准确率与未见游戏成功率衡量的是不同能力,前者隔离单个决策,后者还包含执行质量,例如是否发出合法动作与是否重复访问位置,阅读时宜把两者分开看待。论文提到将公开代码、检查点与实验脚本,独立复现与扩展有待这些材料发布后确认。

来源