Agensh:把多智能体组织扩展到 1,024 个智能体
核心概要
Agensh 提出一种无中心编排者的自组织多智能体 harness,用共享工作区、消息接口与共享上下文支撑并发 worker 的异步协作循环,在 ProgramBench 五个最难任务上把 1 到 128 个智能体的平均最终测试通过率从 19.31% 提升到 28.78%,并在 pandoc 上把 1 到 1,024 个智能体的通过率从 33.89% 提升到 55.06%。
深度剖析
Agensh 把多智能体 harness 的中心编排者去掉,改由并发 worker 自行发现、认领并完成子任务,通过共享工作区、消息接口和共享上下文三项基础设施把个人进展汇成组织成果。 相较 Codex sub-agent、Claude Code sub-agent 与 agent teams、Copilot fleet、Kimi Agent Swarm 等以编排者-工作者结构为主的框架,这里把任务发现、依赖协调与结果整合的责任下放给 worker 自身。 论文给出五步协作循环(收集上下文、认领子任务、执行动作、验证结果、合并进展)与三项基础设施的具体设计,并说明共享工作区用 Gitea、消息接口用 Mattermost 实现,共享上下文沿用 DeLM 的核心思路并调整了工具格式与 worker 指令。
在 ProgramBench 五个最难任务上,智能体数量本身构成一条新的扩展维度:固定模型 GPT-5.6-sol (high)、固定底层 harness Copilot 与 6 小时预算,1、8、32、128 个智能体的平均最终测试通过率依次为 19.31%、20.68%、26.52%、28.78%。 此前多智能体系统的扩展讨论多集中在模型能力或编排策略,这里把“智能体数量”作为可独立调节的扩展轴,并给出跨五个任务的单调上升趋势。 五个任务为 FFmpeg、gromacs、pandoc、PHP-src、ctags,参考仓库含数千文件、数十万至数百万行代码;1 到 128 个智能体带来 9.47 个百分点、约 49% 的相对提升。
更多并发智能体不仅提高最终分数,也缩短达到同一分数所需的时间:在 pandoc 上 128 个智能体在 30 分钟检查点超过 30% 通过率,32 个与 8 个智能体分别在 60 分钟与 90 分钟检查点首次超过该阈值,单智能体在前两小时内始终低于该阈值。 这把“延迟”与“质量”放在同一扩展框架下讨论,说明智能体数量可以换取时间预算内的更早收敛。 证据来自同一 6 小时预算下的检查点对比,模型、harness 与评估配置保持一致。
在 pandoc 上把组织扩展到 1,024 个智能体,最终测试通过率从单智能体的 33.89% 升到 128 个智能体的 50.94% 与 1,024 个智能体的 55.06%;worker 轨迹显示自组织合作形态随规模逐步出现并标准化。 8 个智能体时出现接口约定与重叠认领的自行协商,32 个智能体时出现多 worker 联合贡献与更广的整合参与,128 个智能体时出现按经验选择评审者、责任转移与可复用的标准化整合流程,1,024 个智能体时出现组织规模上的角色专业化与同领域 worker 的接管恢复。 所有 worker 使用同一循环、同一提示词(仅 worker ID 不同),合作形态因此可归因于规模而非个体指令差异;1,024 worker 实验分布在 16 个节点、每节点 64 个智能体。
启示与展望
该结果面向的是在无网络、固定 6 小时预算下从零重建参考软件行为的 ProgramBench 场景,评估对象是 GPT-5.6-sol (high) 配合 Copilot 作为底层单智能体 harness 的配置;论文说明 Agensh 是叠加在单智能体 harness 之上的组织层,因此其收益适用于可被拆分为大量可并行子任务、且能通过共享工作区与消息接口协调的长周期工程任务。对希望在不更换模型的前提下提升复杂任务完成度或压缩达到目标分数所需时间的团队,这套共享工作区、消息接口与共享上下文的三件套提供了可直接参照的组织结构。
论文报告的是 ProgramBench 上的测试通过率与轨迹观察,其他任务族、其他底层模型或其他底层 harness 下智能体数量的收益曲线是否同样单调上升,仍需更多证据;共享上下文条目有长度上限(100 字符,PATCH_SUMMARY 为 300 字符),在更长任务周期中信息压缩带来的影响值得继续观察;此外,1,024 智能体实验目前只在 pandoc 单一任务上给出,跨任务的超大规模表现仍是开放问题。
