跳到主要内容
返回时间线
arXiv来源发表:

WideSWE 用 120 个跨仓库任务测编码智能体:最高仅解出 42.50%,联合执行比独立执行更省请求

核心概要

研究者从 103 个软件生态、1,729,171 条 PR 中筛出 120 个需要跨多个仓库协同改动的真实任务(60 个缺陷修复、60 个新功能),评测七种编码智能体配置,完整任务成功率介于 10.83% 与 42.50% 之间,最高为 Codex CLI 搭配 GPT-5.6-sol,并发现联合执行与逐仓库独立执行各有得失。

AI-generated editorial illustration: WideSWE: Can Coding Agents Coordinate Changes Across Repositories?

深度剖析

论文提出 WideSWE,把「同一功能或缺陷修复需要跨多个仓库协同改动」形式化为可执行评测任务:每个任务至少涉及两个计分目标仓库,只有所有目标仓库的 F2P 与 P2P 测试全部通过才算解决。 此前的 SWE-bench、DeepSWE、ProgramBench 等基准主要把任务完成度限制在单一代码库内,WideSWE 把跨仓库协同本身作为评测对象。 任务来自 103 个活跃软件生态中显式互相引用的已合并 PR,经人工评审与可执行验证后保留 120 个任务,覆盖 41 个生态、253 个目标仓库实例、2,815 个 F2P 与 22,139 个 P2P 测试。

七种智能体配置的完整任务成功率在 10.83% 至 42.50% 之间,最高为 Codex CLI 搭配 GPT-5.6-sol;该配置在 83.33% 的任务中至少解决一个目标仓库,但只有 42.50% 的任务全部解决。 结果把「仓库级进展」与「任务级完成」区分开来,说明单仓库通过并不等于跨仓库请求被满足。 在 120 个任务上评测七种配置,报告 case、repo、F2P、P2P 与 API 请求数等多层指标;未解决任务中多数(52.08%–69.57%,Gemini 除外)至少有一个仓库通过全部 F2P 测试。

失败轨迹被归为三类:未识别完整改动范围、识别到必要改动却未交付、以及改完所有目标仓库仍未满足要求;其中「改后失败」在多数配置中占比最高。 相比只报告通过率,论文用最终 diff 与轨迹证据定位完成度在何处断裂,并给出 91.2% 标注一致性的两阶段标注流程。 Codex CLI–GPT-5.6-sol 的三类占比为 37.68%、2.90%、59.42%;Gemini 的「识别未交付」占比达 52.34%,且其中 82.14% 停留在调查、方案规划或准备性检查阶段。

在 89 个提示相同的配对任务上,联合执行解出 40.45%,独立执行解出 35.96%;独立执行把缺陷修复成功率从 34.48% 提升到 44.83%,却把功能成功率从 43.33% 降到 31.67%,且平均 API 请求数为 296.6 对 94.7。 论文把「一次在生态工作区中联合执行」与「每个目标仓库单独跑一次」在相同提示下直接对比,并指出跨仓库上下文既可用于实现也可用于验证。 配对比较覆盖 89 个任务(29 个缺陷修复、60 个功能);联合执行中失败且未被修改的仓库有 60.00% 在独立执行下成功,而已被修改的仓库仅 9.43% 恢复。

启示与展望

该基准面向需要跨两到三个仓库协同完成同一功能或修复的场景,任务在 Linux 环境中评测,工作区还提供最多 20 个不计分的上下文仓库(中位数为 3)。它适合用来比较不同智能体配置在跨仓库协同上的表现,也适合用来研究联合执行与逐仓库独立执行的差异。论文明确说明,结果不适用于涉及更多仓库或需要其他平台的任务。

论文指出,联合与独立执行的比较匹配的是每次运行的资源上限,而非每个多仓库任务的总预算,因此该对比用于考察「分开做能否缓解跨仓库困难」,而非在等总预算下分离执行范围的影响。仓库恢复率的组间差异被作者描述为描述性而非因果。任务类型与语言组合上的差异(例如多语言家族缺陷修复普遍优于单语言家族,而功能任务不遵循同一模式)来自本样本,论文提示不应外推。此外,任务挖掘与筛选流程涉及多轮人工评审,具体案例的取舍细节需查阅附录。

来源