CoTrace 用与运行时匹配的轨迹配方,把 Qwen3.5-9B 在 Tmax 上从 78 提升到 88(RL 变体达 90)
核心概要
该工作提出 CoTrace——一种在模型与运行时(harness)交替协同演化中显式管理轨迹路由、来源匹配与课程刷新的数据配方:它把执行失败导向 harness 合成,只用在已采纳运行时下验证成功的轨迹训练策略;在 Tmax 的 102 任务评测划分上,Qwen3.5-9B 经监督微调从 78 提升到 88,在线强化学习变体达到 90,而规模更大的跨 harness 混合语料却未带来任何被采纳的模型更新。
Figure 1: Overview of CoTrace and the shared data interface in model–harness co-evolution. Bottom: the closed loop. A task agent with the adopted harness H ∗ H^{*} and policy weights θ \theta solves executable terminal tasks and fills a shared history of trajectories; harness evolution reads that history to edit prompts, processors and tools and selects the next H ∗ H^{*} , while model training updates θ \theta before the subsequent round of search. Top: the data recipes that turn the history into model-training data, from the baseline supervised fine-tuning (SFT) recipes that pool every successful search trajectory (all-evolve) or successes across sibling candidate harnesses (mixed siblings), to CoTrace-SFT, which keeps only trajectories whose provenance matches H ∗ H^{*} and tops them up with fresh rollouts under H ∗ H^{*} , and CoTrace-RL, which learns online by reinforcement learning (RL) from rewards on frontier tasks rolled out under H ∗ H^{*} .
arXiv深度剖析
CoTrace 把协同演化中的执行数据显式分流:失败轨迹按最早未恢复故障聚类后用于 harness 合成,而策略监督只使用与已采纳运行时指纹匹配的验证成功轨迹,并在覆盖不足时用同一 harness 下的新采样补齐。 此前的 harness–模型协同演化方法把搜索期间产生的轨迹当作无差别的回放缓冲,未区分轨迹来源;CoTrace 将轨迹来源(提示模板、工具绑定、处理器的哈希指纹)作为数据选择的一等变量。 在受控的锦标赛搜索对比中,混合兄弟 harness 语料每轮提供 149–308 条轨迹却产生 0 次被采纳的模型更新,而匹配配方仅用 30–50 条即贡献 2 次被采纳更新(9B)。
组件级晋升(Ratchet)在冻结的 102 任务划分上、固定另一组件的前提下评估每个候选,使每次被采纳的增益可归因到单一组件,并拒绝回退更新。 该协议把 harness 搜索与策略训练解耦为可审计的交替通道,并记录每次晋升决策,而非只报告成对总分。 在 8 条链提出的 17 个已赢得演化集搜索的 harness 候选中,仅 9 个提升了晋升划分,平均效应 +0.18 任务;交叉评估显示某次转换中模型与 harness 增益可加而非交互。
课程刷新(Refresh)仅在任务既被解决又被纳入训练语料后才退役,使演化集持续向残余前沿移动。 把任务退役与训练信号可用性绑定,避免任务在成功尚不可用前离开,同时保持搜索与训练聚焦于移动前沿。 一条链中演化集得分从 34→26→17(共 50)而晋升得分从 75→81→83(共 102);强化学习链第三次迭代一次性退役 50 个任务中的 40 个,其最终候选是唯一回退的阶段(85 对在位者 90)。
跨域迁移主要由协同演化的模型–harness 对决定,而非单独的策略:同一检查点换用不同运行时,表现显著改变。 将迁移分析从仅比较检查点扩展到比较模型–harness 配对,显示仅检查点增益在陌生运行时下大多消失。 在 SWE-bench Lite 上,三个检查点在 mini-swe-agent 下分别解决 34.7%、24.7%、36.7%;各自配对其采纳的 harness 后均改善,SFT 从 24.7% 升至 35.0%,其无补丁结果从 155 降至 64;强化学习配对达到 41.0%。
启示与展望
该配方面向在可执行终端任务上、以验证器给出二元奖励的智能体后训练场景,适用于模型与运行时需要交替更新的协同演化流程。它使研究者与工程师能够:把失败证据定向到 harness 合成、把策略监督限定在与部署运行时匹配的验证成功轨迹上、并在任务既解决又被纳入语料后推进课程。在 9B 规模上,紧凑匹配语料在每轮 47 GPU 小时的训练成本下带来模型侧增益;在 4B 规模上,当干净成功轨迹稀疏时,在线强化学习仍能从同一策略获得相对奖励信号。跨域评估表明,把检查点部署在其协同演化的运行时内可抑制早期执行故障与无补丁结果,这一结论针对所研究的运行时与基准。
证据来自少量各运行一次的协同演化链,晋升划分仅 102 个任务且单次评估波动约两任务,因此链间一两任务的差异不宜作为排名;监督与强化配方未在算力上对齐,harness 搜索依赖一个专有元智能体,仅公开被采纳的配置。研究覆盖一个模型家族的两个规模、一个任务来源与两个外部基准,迁移发现描述这些运行时而非一般运行时。各链在课程饱和时停止,更大的任务储备能否延续增益仍是开放问题。此外,强化学习阶段曾出现数据通路缺陷(策略从未发出终止提交动作导致奖励恒为零),修复提示模式与沙箱工作目录后奖励才非零,这提示同类数据面问题可能被误读为能力瓶颈。
