跳到主要内容
返回时间线
arXiv来源发表:

无状态语言代理SLA在十亿token预算下于软件工程、内核优化与算法设计任务上取得最佳终局结果,并以少93%的token追平最强内核基线

相关研究与后续进展

核心概要

该工作提出无状态语言代理(SLA):研究状态由harness持有、每次调用重建角色专属上下文,无状态Advisor依据harness汇总的证据向并行Worker分派具体实验;在软件工程、内核优化与算法设计任务上以最高十亿累计token的预算对比EvoX、CORAL与SwarmResearch,SLA在每个任务上取得最佳终局结果,在Anthropic内核任务上以少93.1%(Claude Code下84.4%)的token追平最强基线终局性能,消融显示聚焦上下文与显式分派各自贡献进展且效应可随运行累积,Advisor仅消耗0.24–0.51%的token。

Source-provided article image: Stateless Language Agents: Scaling Long-Horizon Automated Research
Figure 1 ·

Figure 1: SLA sustains research progress over long horizons. (a) On Anthropic kernel optimization, SLA finds stronger solutions and reaches the strongest baseline’s mean final performance with 14.5 × \times fewer tokens (a 93.1% reduction); every SLA run finishes ahead of every baseline run. Thick curves show means over three runs per method; thin curves show individual runs. (b) On all four FrontierSWE tasks, SLA trails the strongest per-task baseline at 175M tokens (25% of the budget, open circles) but leads at 700M (full budget, filled circles). All results use Codex with GPT-5.5.

arXiv

深度剖析

SLA在全部评测任务上取得最佳满预算结果,并在多数配置中以更少token追平最强基线。 此前AutoResearch评测多以迭代或模型调用计预算、基准早期饱和,未检验长程下方法能否持续把算力转化为进展;该工作以累计token为尺度在最高十亿token预算上比较。 Anthropic内核任务上SLA三次运行全部优于九个基线运行(最差SLA 1122 cycles对最好基线1191 cycles);相对各任务最强基线,内核cycles降低8.1–12.8%,FrontierSWE平均提高4.95分,SOL-ExecBench三项平均提高5.5%,Structured-LWE提高1.5分;Anthropic内核Codex下追平目标仅需67.9M token,SwarmResearch需986.3M。

聚焦上下文与显式分派各自贡献进展,且效应可随运行累积。 消融从相同检查点出发,只改变进入各上下文的内容或Worker是否收到分派,从而把上下文管理与实验选择作为可分离的设计变量检验。 从共享检查点续跑,去掉Advisor上下文重建、Worker上下文隔离或Advisor分派在每项比较中都降低平均进展;去掉Worker隔离在100M token续跑中损失5–11 cycles,而在完整1B运行中损失224 cycles(1336对1112.0 cycles);无分派时并行Worker重复实现同一功能。

显式协调开销很低,且协调与实现分离使Worker模型可按任务选择。 与SwarmResearch由长运行Shepherd承担协调不同,SLA的Advisor每次epoch开启新会话,协调成本与实现成本可分别核算。 Advisor消耗0.24–0.51%的token与1.20–2.29%的模型成本,SwarmResearch的Shepherd为8.39–10.70%的token与6.14–7.35%的成本;在100美元匹配成本下,GPT-5.4 mini Worker在GitZig上得分20.88高于GPT-5.5 Worker的19.68,而Anthropic内核上GPT-5.5 Worker更好。

评测视野会改变方法排序与组件结论。 该工作报告多个累计token预算下的结果,而非单一短预算或早期饱和基准。 FrontierSWE上SLA在25%预算时四项任务均落后最强基线、满预算时四项均领先;去掉Worker隔离的代价在100M续跑与完整运行之间相差一个数量级以上;更宽Worker池在25%预算时落后337 cycles,满预算时与最窄配置相差4 cycles以内。

启示与展望

该结果面向具有可执行评测器、目标可测量但无已知最优解的长程搜索问题,适用于软件工程、内核优化与算法设计三类任务,并在OpenAI Codex与Claude Code两种编码代理配置下验证。它使研究者可以把研究状态放在harness中检查、检查点化与回滚,并从相同检查点做受控消融;也提示在多个累计token预算上报告结果。对希望把长运行拆成短调用以用于后训练、或按任务与时间约束选择Worker数量与Worker模型的实践者,该工作给出了可复用的设计原则与成本核算方式。

多数主结果配置为单次运行,仅Anthropic内核Codex与检查点消融有三次独立运行,因此任务间差异的稳定性仍需更多重复;成本估计不含运行与评测实验的算力。消融改变的是每个代理看到什么,而非是否跨调用保留对话,因此无状态性本身与上下文内容各自的贡献尚未分离。所有任务都有可执行评测器,目标模糊或评测缓慢的场景仍待检验。Advisor的token占比很低,其决策质量与是否应拆分Advisor仍是开放问题;Worker数量的最优值随任务、token预算与时间约束变化。此外,原文表格中部分数值在文本中缺失,摘要只能依据可读到的数字。

来源