跳到主要内容
返回时间线
arXiv来源发表:

JevSpawn 让智能体从自然语言任务自行推导有限动作域,在八项基准中的五项取得最高分并在导航任务上把端到端延迟降到约 41 秒

核心概要

JevSpawn 提出一种免训练的组合式策略,把自然语言任务说明转成可执行的有限动作域,通过并行动作生成、反馈驱动的分支选择、表示修订与保留分支恢复来探索,在八个基准任务上对比七个智能体基线与一个 TypeSafe Jev 变体,在八项中的五项取得最高分,并在 Maze 与 Grid 上同时把成功率提升到 0.96 与 0.95、把端到端延迟从最快基线的 47.91 秒和 61.44 秒降到 40.91 秒和 40.58 秒。

AI-generated editorial illustration: JevSpawn: Adaptive Agentic Inference through Compositional Action Spaces

深度剖析

论文把动作域本身变成策略的一部分:模型从任务上下文与交互规则中推断动作声明,把字段值组合成可执行动作,并用联合概率指导并行生成。 此前的 Jev 式有限域预测要求应用方预先指定字段,而 JevSpawn 让字段随交互被推断和修订,从而把有限预测扩展到需要自主求解的任务,包括空间导航。 论文以公式化的组合策略定义(条件字段域、值树归一化、吸收式空扩展)与附录中的构造示例支撑,并在 Maze、Grid 等任务上使用完整域、无需文本生成即可执行。

并行生成与反馈驱动的状态转移被统一到同一架构中:束宽保留若干赋值,每个赋值对应一个子分支与动作,执行反馈用于分支选择、表示修订,并可从保留分支恢复。 相对只做搜索或只做工作流优化的既有方法,这里把分支保留、操作选择与扩展写进同一个算法,并允许在观察返回后重新评估动作偏好而不必重新生成前序轨迹。 消融显示并行生成贡献显著:束宽从四降到一时,Maze 成功率由 0.88 降到 0.16,Grid 由 0.94 降到 0.58,LightsOut 奖励由 0.61 降到 0.06;在固定四个动作预算下,两个父节点各两个动作在 Maze 与 Grid 上达到 1.00。

共享动作结构与模型前缀复用降低了重复生成与上下文计算,且不增加训练。 论文把已知的声明值视为已知 token 序列并行评估其因果隐状态,只对区分续接的词表项做投影,从而把处理输入 token 数从按分支重复计算降到共享前缀加后缀。 论文给出共享注意力等价性的条件推导,并报告文本解码吞吐在 PPNL 与 LightsOut 上达到 544 与 580 tokens/s,为表中最高值;Maze 与 Grid 全程使用有限评估。

在八个基准任务上,JevSpawn 相对七个智能体基线与一个 TypeSafe Jev 变体表现出任务相关的取舍:五项最高分,导航任务同时改善质量与延迟,但部分任务以更长执行时间换取更高分数。 结果把“有限预测能否支撑持续任务求解”这一问题落到具体任务谱系上,并显示同一架构内 TypeSafe Jev 打分在 PPNL、LightsOut 与 Sokoban 上优于 Qwen 打分,而在 Grid、RushHour、2048、Nullify 上更低。 评测使用 Qwen3.8-27B、四张 H100、batch size 8、上下文 16,384 token、最多 36 轮探索与 300 秒上限;PPNL 1,136 个实例、Maze 25 个初始状态、其余任务各 100 个实例(种子 42–141)。LightsOut 与 2048 上更高分数伴随更长执行时间,Sokoban 的 Pareto 前沿归属较不稳定。

启示与展望

这项工作面向需要从自然语言说明推导动作空间、并通过交互修订该空间的智能体任务,适用于任务规则能给出或允许推断有限字段的场景,例如路径规划、网格导航与序列谜题;对希望在不重新训练模型的前提下降低重复生成与上下文计算成本的系统,它提供了可复用的组合策略与共享前缀计算路径。论文同时给出代码与交互演示,便于在同类基准上复现与扩展。

仍待观察的是:有限字段的推断在开放字符串或缺少显式域的任务上如何稳定工作;束搜索剪枝会丢弃概率质量,可能舍弃评分更高的部分赋值,因此束选择只是对穷举排序的近似;长程实验中 2048 与 Sokoban 在 72 与 108 轮时出现 82%、85% 与 77% 的超时率,去掉时限后 2048 分数从 315.16 升到 1102.24,说明结果对轮数与时限设定敏感;Sokoban 的 Pareto 前沿归属不稳定,仅领先 LLMCompiler 1.50 秒延迟且分数更低;TypeSafe Jev 变体的端到端延迟是 Qwen 打分的 1.4 到 2.1 倍,且包含 API 通信时间。此外,本次读取为全文,但表格与图以文本形式呈现,个别数值的完整对照仍需回到原文核对。

来源