跳到主要内容
返回时间线
arXiv来源发表:

三大前沿编码智能体动态并发实测:长程任务增益有限,token 消耗升至 1.41–3.31 倍

核心概要

该研究首次系统评测 Codex、Claude Code 与 Kimi Code 的原生动态并发机制,在四个长程基准与一个受限基准的 354 个任务上做并发/顺序对照,共 2,124 次执行;结果显示并发在长程任务上收益最大、在受限任务上收益有限甚至为负,token 消耗达顺序执行的 1.41–3.31 倍,并给出四类 13 子类 28 种并发失败模式分类。

Source-provided article image: When Sub-Agents Work in Parallel: The Promises and Pitfalls of Dynamic Concurrency in Long-Horizon Coding Tasks
Figure 1 ·

Figure 1. Overview of the dynamic concurrency mechanisms used by the three coding agents in our study. Separate dashed panels show main agents on the left and sub-agents on the right across three tool rows. Claude executes a scripted sequence of parallel stages and joins. Kimi launches a batch of independent sub-agents and waits for one ordered report. Codex coordinates direct and nested sub-agents while the main agent continues working and integrates returned results.

arXiv

深度剖析

动态并发对任务成功率的影响并不一致:解决率变化从下降 11.9 个百分点到上升 2.3 个百分点,且收益集中在长程基准,尤其是任务跨度最长的 LoopsBench,Codex 与 Claude Code 的任务通过率最多提升 14.3 个百分点,而受限的 SWE-bench Verified 上没有增益,Claude Code 与 Kimi Code 反而显著下降。 此前评测多集中于单智能体系统或预定义协作协议的多智能体系统,且以 SWE-bench 这类小补丁的受限任务为主;该工作首次把评测对象换成前沿编码智能体的原生动态并发,并覆盖需要生成数万行代码的长程任务。 354 个任务、三种智能体、并发与顺序两种设置,共 2,124 次执行,记录 112 亿 token、按标准 API 费率折合 20,780.02 美元;对合并任务组做精确 McNemar 检验并作 Holm 校正,Claude Code 与 Kimi Code 的整体下降统计显著,Codex 的提升不显著。

并发带来独特的成功集合:并发模式在几乎所有智能体与基准上都能解出顺序模式解不出的任务,例如 Claude Code 在 LoopsBench 上仅并发解出四个任务,在 SWE-bench Verified 上尽管总体通过率更低仍仅并发解出五个任务;Codex 在两种模式下总体表现相同,但各自独有解出九个任务。 仅看聚合通过率会掩盖这种互补性,该工作通过成功任务重叠分析揭示并发扩展了智能体的能力边界,而不只是改变平均分。 基于每个智能体在两种模式下成功任务集合的重叠统计;ProgramBench 上无任何采样任务被完全解出,因此以测试通过率大于零作为成功判据。

并发显著抬高资源消耗且不必然缩短时间:平均 shell 调用在每个智能体与基准上都上升,token 消耗达顺序执行的 1.41–3.31 倍,按已解决任务归一化后每个智能体的单任务 token 都增加,Codex 从 7.69M 升至 24.12M;平均运行时间在 15 个智能体-基准组合中的 14 个上升。 这给出了并发收益与代价的定量对照,说明当前并发机制总体上是以大幅资源消耗换取有限的聚合效果提升。 基于记录的服务商用量统计;在两种模式都解出的 366 个案例中,并发有 102 例(27.9%)更快,其中 46 例(12.6%)至少快 20%。

轨迹分析给出四主类、13 子类、28 种并发失败模式的分类,覆盖任务编排、执行治理、全局上下文管理与共享状态与合并;这些模式出现在 650 条被审阅的并发轨迹中,共 804 个实例,其中共享状态与合并问题占比最大(33.2%),并发写占 26.5%。 此前工作多分析单智能体失败或预定义协议下的协作失败,该分类专门刻画动态并发特有的协调失败,并区分功能性失败与预算下的性能性失败。 对全部 1,062 条并发轨迹人工标注,先用 50 条轨迹开放式编码建立码本,正式阶段每条由三名标注者中的两人独立标注并记录理由,分歧经讨论并由资深作者裁决,报告单一 Cohen's kappa 一致性值。

启示与展望

该研究面向使用原生脚手架与最高推理强度的三种前沿编码智能体(Codex 配 GPT-5.4、Claude Code 配 Claude Opus 5、Kimi Code 配 Kimi K3),结论适用于所测智能体与基准范围。对实践者而言,动态并发更适合困难、长程、可清晰分解为独立组件、支持同一问题多路并行尝试、或允许独立子智能体验证主实现的场景,而不宜默认开启。对研究者而言,该分类把任务分解与所有权分配、运行时监控与干预、跨隔离上下文的契约与进度传递、共享文件与环境的隔离同步与冲突检测列为可继续推进的方向。作者已公开 2,124 条轨迹清单、评测器摘要、运行器与解析器版本、轨迹哈希、归一化事件记录、定性码本与每个案例的证据,便于复现与再分析。

智能体执行具有随机性,而长程评测的高成本限制了大规模重复运行;作者以 Codex 在 LoopsBench 上的顺序模式结果接近原始报告、且原 LoopsBench 研究报告重复尝试下趋势稳定作为佐证。人工分析可能引入主观判断,作者以 50 条轨迹试点码本、双人独立标注、记录理由与资深作者裁决来约束。外部效度上,结论限定于所测智能体与基准,替换模型可能因后训练对脚手架工具接口的适配而改变行为。此外,ProgramBench 上所有智能体任务通过率为 0%,该基准的结论只能以部分进展(测试通过率)来解读;并发在部分基准与智能体上收益方向相反,具体任务结构如何决定收益方向仍是开放问题。

来源