跳到主要内容
返回时间线
arXiv来源发表:

Chronos 用 PR 关系图检索仓库演化经验,把 SWE-Agent 平均解决率从 69.2% 提升到 72.9%

核心概要

Chronos 是一个测试时框架,把已合并的 PR 蒸馏成四字段经验卡,并用代码、开发者意图与组织三类共十一种关系构成带权有向多重图;任务时先做语义检索定位入口卡,再沿关系做加权多跳扩展,检索到的经验同时用于候选补丁生成与选择。在 SWE-Bench Verified 上,该完整流程在六个 LLM 后端上均提升 SWE-Agent,平均解决率从 69.2% 升至 72.9%,MiniMax M2.5 下达 79.8%;同一后端在 SWE-Bench Pro 上从 48.3% 升至 51.7%,在 FEA-Bench Lite 上从 41.0% 升至 43.5%。

Source-provided article image: Chronos Enables Code Agents to Reason over Software Evolution
Figure 1 ·

Figure 1. Resolution rates of representative agents across three benchmarks. Labels identify the backbone and scaffold of each configuration; Tables 4 and 5 give our backbone-specific comparisons. Each system submits one final patch per task. Colors distinguish Chronos, open-scaffold systems, and proprietary systems. Comparison of Chronos with open-scaffold and proprietary code agents on three software-engineering benchmarks. Colors identify the three system groups, and the bars display resolution rates with one final patch submitted per task.

arXiv

深度剖析

把仓库历史组织成可检索的关系结构:每个已合并 PR 被蒸馏为 Summary、Signals、Motivation、Solution 四字段经验卡,卡之间用十一种类型化边连接,分为代码演化、开发者意图、组织/社交三层,遍历权重从 1.0–1.5 递减到 0.3–0.45。 此前以卡片形式复用修复经验的工作(如 MemGovern)主要按查询与索引的嵌入相似度排序;Chronos 在语义入口之外增加了沿类型化 PR 关系的加权扩展,使描述侧重不同问题的相关变更也能进入候选。 关系类型、检测判据、节点覆盖率与权重区间在表 1 中逐项给出;图构建规则与默认权重公式在三个基准上保持不变,未做按基准调参。

同一记忆同时服务于生成与选择:补丁导向的变更代理围绕设计意图检索,验证策略代理围绕行为差异与回归风险检索,各自产出一个候选补丁;演化管家独立查阅记忆与当前源码,在随机化 X/Y 顺序后选择其一。 把仓库记忆从单一生成阶段的辅助上下文,扩展为对“如何实现”和“哪个实现更合适”两个决策都提供依据,且检索服务与代理角色分离,无需微调模型。 消融显示单代理变体分别为 78.4% 与 77.8%,均高于 76.4% 的 SWE-Agent 基线;两者加管家达到 79.8%,为所评估配置中最高。

在三个基准上验证任务解决率:SWE-Bench Verified 上六个后端全部提升,平均 69.2%→72.9%,MiniMax M2.5 下 76.4%→79.8%;SWE-Bench Pro 48.3%→51.7%;FEA-Bench Lite 41.0%→43.5%。 增益同时出现在标准缺陷修复、长跨度仓库级修改和新功能实现三类任务上,说明同一套记忆构建与检索流程可跨任务类型复用。 SWE-Bench Verified 覆盖 500 个任务、12 个仓库与六个后端;完整配置在 MiniMax M2.5 上重复五次,均值 80.0%,样本标准差 0.37pp,最低一次 79.6% 仍高于 76.4% 的基线参考值。

人工评估显示关系检索在固定深度下提升经验可用性:每任务取十张卡时,图检索把平均有用卡数从 1.24 提升到 2.87,把至少获得一张有用卡的任务比例从 68% 提升到 89%;随机检索仅为 0.18 与 14%。 把“检索质量”拆成覆盖广度(Hit)与每任务可用经验量(Useful)两个指标,并进一步用逐类边移除实验衡量各关系类型的检索价值。 由两名具备专业软件工程经验的研究成员独立标注 100 个 SWE-Bench Verified 任务,分歧经讨论裁决;移除实验显示代码连续性关系 precedes(0.60)与 extends(0.44)的损失最大,开发者意图关系次之,组织关系损失在 0.06–0.18。

启示与展望

该框架面向以 PR 为演化记录的仓库,检索按任务实例限定在目标仓库内,并以任务 PR 的创建时间为时间截点,排除创建或合并时间不早于该截点的 PR;这一范围同时约束语义入口选择与图扩展。它适用于缺陷修复、长跨度仓库级修改与新功能实现三类已评估任务,且卡片模式、图构建规则与默认权重公式在三个基准上共用,历史内容取自各目标仓库。对使用者而言,可直接复用的是“开发决策加其成立条件”这一单元:Motivation 说明当时的行为缺口或假设,Solution 给出当时的实现逻辑,二者合读用于判断哪些部分可迁移到当前代码。检索服务与代理角色分离,因此同一记忆可服务单候选代理,也可服务“两个候选加独立选择”的流程;单代理变体在相同记忆接口下分别达到 78.4% 与 77.8%。

蒸馏由 LLM 完成,可能遗漏上下文或引入不准确之处;人工研究衡量的是任务条件下的有用性,而非来源层面的事实准确性,且两名标注者同属研究团队,其共同背景可能带来评估者偏差。关系权重是人工设定的先验,在全部评估设置中保持不变,对权重数值常数的敏感性尚未测量;逐类边移除的损失也不是固定总量的可加份额,其排序反映的是在其余图结构存在时各关系类型的检索价值。重复运行统计只描述 MiniMax M2.5 的完整配置,基线及其余配置为单次运行;单代理变体把图检索与角色特定提示结合,其增益反映该组合;移除某一策略同时移除了第二候选与管家选择,因此完整流程的额外增益反映二者的联合效果。评估覆盖 SWE-Bench Verified 的六个后端,以及两个迁移基准上的 MiniMax M2.5,其他后端与仓库上的表现仍待观察。

来源