arXiv 2026年10月7日该工作提出无状态语言代理(SLA):研究状态由harness持有、每次调用重建角色专属上下文,无状态Advisor依据harness汇总的证据向并行Worker分派具体实验;在软件工程、内核优化与算法设计任务上以最高十亿累计token的预算对比EvoX、CORAL与SwarmResearch,SLA在每个任务上取得最佳终局结果,在Anthropic内核任务上以少93.1%(Claude Code下84.4%)的token追平最强基线终局性能,消融显示聚焦上下文与显式分派各自贡献进展且效应可随运行累积,Advisor仅消耗0.24–0.51%的token。该工作提出无状态语言代理(SLA):研究状态由harness持有、每次调用重建角色专属上下文,无状态Advisor依据harness汇总的证据向并行Worker分派具体实验;在软件工程、内核优化与算法设计任务上以最高十亿累计token的预算对比EvoX、CORAL与SwarmResearch,SLA在每个任务上取得最佳终局结果,在Anthropic内核任务上以少93.1%(Claude Code下84.4%)的token追平最强基线终局性能,消融显示聚焦上下文与显式分派各自贡献进展且效应可随运行累积,Advisor仅消耗0.24–0.51%的token。无状态语言代理SLA在十亿token预算下于软件工程、内核优化与算法设计任务上取得最佳终局结果,并以少93%的token追平最强内核基线该工作提出无状态语言代理(SLA):研究状态由harness持有、每次调用重建角色专属上下文,无状态Advisor依据harness汇总的证据向并行Worker分派具体实验;在软件工程、内核优化与算法设计任务上以最高十亿累计token的预算对比EvoX、CORAL与SwarmResearch,SLA在每个任务上取得最佳终局结果,在Anthropic内核任务上以少93.1%(Claude Code下84.4%)的token追平最强基线终局性能,消融显示聚焦上下文与显式分派各自贡献进展且效应可随运行累积,Advisor仅消耗0.24–0.51%的token。该工作提出无状态语言代理(SLA):研究状态由harness持有、每次调用重建角色专属上下文,无状态Advisor依据harness汇总的证据向并行Worker分派具体实验;在软件工程、内核优化与算法设计任务上以最高十亿累计token的预算对比EvoX、CORAL与SwarmResearch,SLA在每个任务上取得最佳终局结果,在Anthropic内核任务上以少93.1%(Claude Code下84.4%)的token追平最强基线终局性能,消融显示聚焦上下文与显式分派各自贡献进展且效应可随运行累积,Advisor仅消耗0.24–0.51%的token。