ActiveSaddler 让训练场景随 harness 共同演化,在 GAIA2 与 Terminal-Bench 2.0 上把 Pass@1 分别提高 4.4 和 7.5 个百分点
核心概要
该工作把离线 harness 优化中的训练场景选择形式化为自动课程学习问题,提出 ActiveSaddler:用非平稳多臂老虎机把反复出现的失败抽象为可复用的失败模式臂,估计每个臂的潜在学习进展并自适应平衡重访已知弱点与探索未见场景,在 GAIA2 和 Terminal-Bench 2.0 上相比同一优化器使用固定场景顺序分别把测试 Pass@1 提升 4.4 和 7.5 个百分点。
深度剖析
论文指出既有自动 harness 优化方法主要优化“如何更新 harness”,而生成反馈的训练场景通常被预先固定为完整训练集或优化前排好的小批量;随着 harness 演化,哪些场景最有价值会改变,因此课程本身也应随之调整。 作者把这一被忽略的维度形式化为预算受限的离线 harness 优化中的自动课程学习问题,并给出课程策略选择训练场景集合的形式化目标。 该论断由问题形式化(式 5、式 6)与对固定顺序优化下“许多训练中观察到的失败在最终 harness 中仍未解决”的观察共同支撑,属于概念与实证动机层面的论证。
ActiveSaddler 把课程建模为非平稳老虎机,臂由观察到的失败在线实例化:失败模式提取器把失败抽象为症状并归一化为可复用的失败模式臂,臂优先器用 LLM 从严重性、可修复性、广度和副作用风险四方面估计学习进展分数,探索控制器决定继续修复已知臂还是执行未见场景。 与把臂定义为类别或单个场景的做法不同,失败模式臂以“harness 弱点”而非单次失败执行作为优化目标,使跨场景的同类失败共享同一优化目标,并让臂集合随优化过程扩展。 方法细节在正文第 4 节与附录 A、B、K 中给出,包括模式注册表、pattern CLI 命令集、算法 1/2 以及三类提示模板;消融实验显示类别臂和场景臂分别使 GAIA2 测试 Pass@1 下降 3.0 和 3.6 个百分点,使 TB2 下降 10.8 和 6.7 个百分点。
在 GAIA2 与 Terminal-Bench 2.0 上,ActiveSaddler 取得最强测试表现,相比同一 AutoSaddler 优化器使用优化前固定的随机场景顺序分别提升 4.4 和 7.5 个百分点,并优于 GEPA、Meta-Harness、AutoSaddler 以及按类别或场景准确率排序的固定课程。 这是首次在 harness 优化中把“哪些训练场景产生反馈”作为可自适应维度,并在同一 rollout 预算下与固定课程和现有优化器直接比较。 主表报告 GAIA2 测试集 300 个任务、TB2 测试集 40 个任务,每个优化后 harness 做三次测试执行并报告平均 Pass@1 与标准差;附录 C 的两次独立 GAIA2 运行中 ActiveSaddler 均优于所有固定顺序基线,附录 E 显示把 ActiveSaddler 用于 GEPA 可把平均 Pass@1 从 54.2 提升到 57.2。
消融显示增益依赖三个设计要素:动态构造优化目标、估计其演化效用、以及平衡继续优化与新失败发现;去掉臂优先器使 GAIA2 和 TB2 分别下降 4.5 和 7.5 个百分点,把自适应探索换成每五轮固定探索使两者分别下降 4.5 和 8.3 个百分点。 这些消融把课程层三个组件各自的贡献分离出来,并给出非 LLM 替代方案(EMA 失败持续性打分、UCB-AIR 计数式探索)分别低于 ActiveSaddler 3.1 和 4.2 个百分点的对照。 消融在相同优化器与相同 rollout 预算下进行;附录 G 的失败命中率显示失败模式臂在 GAIA2 为 52.9%(类别臂 36.4%、场景臂 17.6%),在 TB2 为 60.4%(30.5%、36.6%),附录 J 显示 Pull 决策时未解决臂数量是 Draw 时的 2.0 倍(GAIA2)和 6.9 倍(TB2)。
启示与展望
该工作面向预算受限的离线 harness 优化,采用标准训练/开发/测试划分,课程层与底层优化器解耦,因此可直接叠加在 AutoSaddler、GEPA 等离线优化器之上;受益者是需要为 LLM agent 自动调优提示、工具接口与运行时控制逻辑的研究与工程团队。作者明确说明这是研究性探索,实验全部在基准环境与公开/合成任务数据上完成,未使用真实用户数据,也未评估生产环境的安全性、安保、隐私或治理就绪度,因此结果适用于受控基准设定下的优化有效性,而非生产部署许可。
失败模式臂由 LLM 从执行失败中归纳并归一化,其粒度与稳定性在不同任务分布下如何变化,正文通过案例与命中率给出观察,但仍是一个值得继续追踪的问题。臂优先器与探索控制器都依赖 LLM 判断,附录 D 显示简单非 LLM 替代方案效果较低,说明这类判断在当前设定下承担了实质作用,其在更强或更弱模型上的表现尚待检验。成本分析显示 ActiveSaddler 的优化器侧开销更高(GAIA2 每个生成补丁 11.44 美元对 AutoSaddler 的 7.87 美元),端到端成本优势来自 rollout 分配效率,这一权衡在不同价格与预算结构下是否保持需要进一步观察。此外,本文档为全文解析,图表以文字与表格形式呈现,部分图示细节(如概率质量随迭代变化的完整轨迹)只能通过正文描述与附录数值间接理解。
