跳到主要内容
返回时间线
arXiv来源发表:

把并行编码智能体的协调当作调度问题:NP-Bench 让干净集成率从 1/9 升到 9/9,并在实时契约变更中把 0.00 提升到 1.00

核心概要

作者把并行编码智能体的协调重新表述为调度问题:在开工前依据每个工作项声明的范围做不相交划分,并按生产者—消费者依赖图排序合并;他们将其实现为 Nerveplane 中的规划器,并用基于真实 git 合并的三臂基准 NP-Bench 验证,确定性场景下干净集成成功率由 1/9 升至 9/9、合并冲突由 13 降至 0,实时破坏性契约变更中前沿模型由 0.00 升至 1.00、小模型升至 0.60。

Source-provided article image: Verifying Coordination in Parallel Coding Agents: NP-Bench and a Scheduling Planner
Figure 1 ·

Figure 1: Nerveplane observes each agent’s worktree by polling git (passive sensing), then routes only the relevant events and, with the planner, hands each agent a disjoint scope and a merge slot before the edits happen, rather than warning after a collision is sensed.

arXiv · 第 4 页

深度剖析

NP-Bench 是一个以环境为基准的三臂验证器(无协调 C0、反应式检测 C1-detect、主动规划 C1-plan),从真实 git 合并读取地面真值信号,包括干净合并成功率、合并冲突、浪费的代码行、范围泄漏、消费者适配率与重复犯错率。 既有编码智能体评测(如 SWE-bench、HumanEval、LiveCodeBench)衡量单智能体单仓库任务成功,不衡量并行智能体能否干净集成;NP-Bench 补上这一协调轴,并把“协调是否有用”从断言变成测量。 Tier A 为确定性模拟,驱动真实的注册、工作树感知、冲突检测与规划器核心,并以真实 git 集成打分,受 CI 门控且可复现;Tier B 用真实智能体在隔离 git 工作树中无头运行,分支经真实合并后打分,非确定性且报告 Wilson 95% 区间。

在九个脚本化场景中,规划器把干净集成成功率从 C0 的 1/9、C1-detect 的 4/9 提升到 9/9,合并冲突总数由 13 降至 0,浪费代码行由 54 降至 0;在并发争用场景中反应式检测退化为与无协调相同,而规划器保持为零,且优势随智能体数量单调增长。 反应式协调在顺序依赖场景中与规划器打平(警告来得及落地),但在智能体速度的并发场景中警告总是晚于编辑;规划器通过事前不相交划分与拓扑合并顺序从构造上避免冲突。 确定性三臂实验覆盖共享文件、契约、跨仓库扇出、独立对照以及并发/高争用变体;跨仓库路由在扇出场景中命中两个真实消费者且不误报无关服务(100% 命中、0% 误报);对照场景三臂均成功且不产生警告。

实时契约迁移场景中,生产者把发票金额字段由美元 amount 改名为整数分 amountCents,消费者若不适配则合并干净但语义损坏;规划器在前沿模型上把干净集成率从 0.00 提升到 1.00,在小模型上提升到 0.60,在第二家厂商的模型上同样为 1.00,而 C1-detect 在所有模型上均为 0.00。 模糊的即时警告(“队友可能正在编辑”)对实时智能体几乎等同于无协调:原始回复显示消费者知道“可能有变化”却仍按旧字段编码;只有事前给出确切范围与契约迁移信息才有效。 实时运行跨两个模型家族(Claude Opus 4.8、Claude Haiku 4.5 与 OpenAI GPT-5-Codex),关键契约单元在前沿模型上样本量较大且规划器的 Wilson 区间与基线清晰分离;C0 的失败不是能力失败,因为所需信息根本不在消费者工作树中。

在共享文件场景中,被重新分配的前沿模型智能体范围泄漏为 0.00,即全部遵守被指派的范围;另一项跨会话记忆实验中,重复犯错率在强模型与弱模型上均从 1.00 降至 0.00。 这回答了“不相交范围不冲突”是否只是同义反复:真实智能体确实尊重被指派的范围;而记忆效应是信息效应,因为正确选择无法从仓库中恢复,模型强度无法替代。 范围泄漏在共享文件场景(前沿模型)测得为 0.00,多个智能体自述是“按协调”行事;记忆实验使用两个对称认证后端、其被认可者不出现在代码中的沙箱仓库,会话 1 记录决定、会话 2 询问导入哪个后端。

启示与展望

该结果面向在同一代码库上并行运行多个编码智能体的团队与平台构建者,适用于工作项的文件范围与消费契约可被声明、且依赖关系构成 DAG 的场景。在此设定下,规划器把冲突清理转为冲突预防:并发工作获得不相交范围,生产者先于消费者合并。作者指出收益来自工作分配方式而非模型推理,因此在所测试的两个能力层级与两家厂商上收益未随模型变强而缩小。系统与 NP-Bench 测试框架开源(Nerveplane v0.17.0),Tier A 确定性且受 CI 门控,可作为机制与路由精度的回归验证;Tier B 提供真实智能体行为证据。跨会话记忆结果说明:把团队决定记录在可查询账本中,可让后续会话的智能体不再重复同一错误。

范围推断仍是未建成的部分:实验中声明的范围由测试框架手工植入,规划器的保证只与这些范围一样好,从符号图或服务图自动推断范围属于未来工作。范围泄漏仅在简单的共享文件场景测量,更微妙的范围上泄漏可能更高。C1-detect 的警告被有意设为模糊,作者认为这符合真实反应式系统的输出,但缺少“详细但迟到”的消融来分离具体性与时机。实时单元中除关键契约单元外多为试点,区间较宽,场景为手工构造;更大样本量与更广场景集是显然的后续运行。此外,路由事实到智能体在适配窗口的规模上并未提升长上下文检索准确率,其价值在成本与容量,这一负结果提示对上下文路由的更强主张需要额外证据。

来源