Mid-Harness 在模型与执行框架之间验证候选动作,把 TMAX-9B 在 TerminalBench-Lite 上的 Pass@1 从 50.00% 提升到 68.03%
核心概要
该工作提出 Mid-Harness,在动作生成器与执行框架之间对候选动作进行采样与验证后再执行其中一个,在保持生成器和框架不变的前提下研究动作级测试时计算扩展:在 TerminalBench-Lite 上,用 GPT-5.6 Sol 作为验证器把 TMAX-9B 的 Pass@1 从 50.00% 提升到 68.03%(8 个候选动作),而弱验证下增加采样宽度收益很小,成对验证在自验证设置中表现最好,把强验证器的响应蒸馏进 TMAX-9B 可进一步提升 Pass@1,且动作级扩展与轨迹级扩展(Best-of-N 与 Sequential Refine)组合后能以更低的估计 token 成本取得更高成功率。
深度剖析
验证质量决定动作采样的收益:在 TMAX-9B 生成器固定、TerminalBench-Lite 上,零样本 listwise 验证把候选宽度从 4 加倍到 8 时 Pass@1 仅从 49.32% 变为 51.02%、Pass@3 从 66.33% 变为 67.35%,而 GPT-5.6 Sol 验证器在同样 listwise 机制下达到 64.63%(N=4)和 68.03%(N=8)。 此前工作把测试时计算用于采样、验证与精炼,但对“何时以及为何”动作级扩展能提升轨迹成功率缺乏系统理解;该工作把候选宽度、验证机制与验证器能力放在固定模型—框架边界上联合比较。 主实验为 TerminalBench-Lite 的 98 个任务、每任务 3 次运行,报告 Pass@1 与 Pass@3;作者指出评估缺少动作级金标准标签,因此候选覆盖是通过强验证器下的轨迹成功率间接探测的。
在自验证设置中,成对(pairwise)验证在所评估的机制中表现最好,用 117k 条来自 GPT-5.6 Sol 的成对响应做 LoRA 蒸馏后,N=8 时 Pass@1 从 54.76% 升到 57.14%、Pass@3 从 71.43% 升到 75.51%,N=4 时 Pass@1 从 54.42% 升到 55.44%,而动作生成器保持不变。 该工作把验证机制(listwise、pointwise、pairwise)与验证器蒸馏作为可分离的变量来研究,并给出蒸馏在离线一致性上的量化变化:分数 MAE 从 2.59 降到 1.05,成对一致率从 59.01% 升到 74.58%,验证一致率从 38.52% 升到 57.79%。 蒸馏使用 244 个训练任务、117,631 条验证器输入,分析使用 21 个不相交的留出任务、10,543 条输入;离线诊断只衡量与教师验证器的一致性,作者明确说明它不衡量动作正确性或轨迹成功率。
动作级扩展与轨迹级扩展互补:在 TMAX-9B 上,用 Mid-Harness 生成 Best-of-N 的源轨迹把 Pass@1 从 55.10% 提到 61.22%(零样本)和 66.33%(蒸馏),在同样的三次环境执行下相对 Best-of-N 单独使用提升 11.23 个百分点;蒸馏 Mid-Harness 与一轮 Sequential Refine 组合把 Pass@1 从 55.10% 提到 60.20%、Pass@3 从 71.43% 提到 75.51%。 此前轨迹级方法(并行验证与顺序精炼)需要新的环境运行,该工作显示在动作执行前插入验证可以在不增加环境运行次数的前提下改善这些轨迹级方法,并给出成本—成功率权衡。 组合实验在 TerminalBench-Lite 上以 TMAX-4B、9B、27B 三个规模进行,报告参考定价 token 成本;作者给出任务级 bootstrap 95% 置信区间,其中蒸馏 9B(+7.14,[+1.36, +12.93])与蒸馏 27B(+5.10,[+0.34, +9.86])的区间位于零以上,其余四个区间包含零。
增益可迁移到其他模型、基准与框架:零样本 Mid-Harness 在全部七种设置中提升 Pass@3 并持平或提升 Pass@1,包括 Qwen3.5-9B 与 Nemotron3.5 Lightning 在 Terminus-2 上、Nemotron3 Ultra 在 Terminal-Bench 2.1 上;在 FeatureBench-Mini 上 TMAX-9B 基线仅 1.45% Pass@1,零样本与蒸馏验证分别提到 5.80% 与 7.25%,TMAX-27B 上蒸馏把 Pass@1 从 17.39% 提到 23.19%、Pass@3 从 26.09% 提到 39.13%。 该工作把动作验证从单一模型家族扩展到 4B 到 550B 的多种生成器、多个基准和两种执行框架,并报告了领域与难度分组的差异。 迁移实验覆盖 TerminalBench-Lite、Terminal-Bench 2.1、SWE-bench-Verified Mini 与 FeatureBench-Mini;作者同时报告蒸馏在 TMAX-9B 的 FeatureBench-Mini 上提升 Pass@1 但降低 Pass@3,且在 Terminal-Bench 2.1 上未超过零样本验证。
启示与展望
该结果面向在终端环境中执行长程任务的智能体,适用于生成器与执行框架保持不变、可在动作执行前插入采样与验证的部署形态;作者在隔离的基准环境中评估,并指出动作验证应作为受限权限、环境隔离与敏感操作人工审批等安全措施的补充而非替代。方法上,Mid-Harness 只改变模型调用包装层,不修改模型权重或服务架构,因此可直接叠加在已有的并行轨迹扩展(Best-of-N)与顺序轨迹扩展(Sequential Refine)之上,且不增加这些方法所需的环境运行次数。作者也指出,蒸馏后的验证器在 4B 到 27B 各规模上均可由对应生成器骨干初始化,成对机制保持不变,这为把动作验证迁移到其他终端智能体提供了可复制的路径。
评估缺少动作级金标准标签,因此验证正确性与候选覆盖只能通过强验证器下的轨迹成功率间接推断,作者也把这一点列为局限。离线诊断衡量的是与教师验证器的一致性而非动作正确性,蒸馏后验证一致率在轨迹后段仍较低(第 17–32 轮为 54.07%,第 1–4 轮为 68.13%),剩余分歧集中在命令语义与执行可行性,占蒸馏验证器被判定失败的 67.4%。决策式(仅输出 A/B)验证在 N=8 时提升 TMAX-9B 的 Pass@1 并降低参考定价成本,但在 4B 与 27B 上低于带推理的对应版本,作者也指出缺少用量记录与独立实时运行限制了该比较的精确性。任务级 bootstrap 区间中四个包含零,作者说明这并不表示没有改进,而是该分析未能把正向差异与零区分开;此外蒸馏验证器在 TMAX-9B 的 FeatureBench-Mini 上提升 Pass@1 却降低 Pass@3,在 Terminal-Bench 2.1 上未超过零样本验证,科学计算任务上 27B 的蒸馏验证 Pass@1 下降 10.0 个百分点,这些分组差异提示增益并非在所有领域一致。
