跳到主要内容
返回时间线
arXiv来源发表:

Harness-Zero 把进化出的智能体外壳蒸馏进 Qwen3.5-9B 权重,宏平均成功率从 23.3% 升到 44.3%,超过保留外壳的 41.7%

核心概要

该工作提出 Harness-Zero:先用 agent-as-harness 让一个“驾驭智能体”在学生智能体的响应边界上审阅并最小化改写其提案,把进化外壳(工具、中间件、技能、记忆)的指导转写成目标外壳动作空间内的可执行监督,再对审阅后的轨迹做 SFT;在 SpreadsheetBench Verified、AppWorld、USPTO 逆合成三个域上,免训练的 agent-as-harness 在六个基准–模型设置上平均 81.1%,高于 code-as-harness 的 78.1%,而蒸馏后的 Qwen3.5-9B 在仅保留最小目标外壳时宏平均从 23.3% 提升到 44.3%,超过基座模型仍挂载进化外壳的 41.7%,并

AI-generated editorial illustration: Harness-Zero: Harness Distillation via Agent-as-Harness

深度剖析

论文把“智能体外壳蒸馏”形式化为一个问题:外壳优化只改进模型外部脚手架,收益绑定在该外壳上,而最优外壳随领域、实例和基座模型变化,共享外壳会损失专门化收益,维护多个外壳又要付出路由与上下文、模型调用、工具调用、编排的持续成本。 此前工作(如 Meta-Harness 一类自动外壳优化、模型–外壳协同进化)让外壳与权重互相强化,但收益仍与外壳耦合;Harness-Zero 明确把“把外壳诱导的行为搬进模型参数、部署时只留固定目标外壳”作为目标。 问题陈述由论文引言与相关工作给出,并引用了一项受控编码智能体研究:更换评测外壳对性能的影响大于训练方法,跨外壳收集反馈训练并未改善向留出的最小 ReAct 外壳的迁移。

方法核心是 agent-as-harness:驾驭智能体在学生响应边界拦截每个提案,用私有参考外壳(由进化外壳适配而来)判断是否干预,通过则原样放行,否则给出在学生动作空间内合法的最小连贯替换;被接受的响应经目标外壳执行,观测进入学生可见轨迹,被拒提案与私有审阅讨论留在轨迹之外,最后对接受的响应做 SFT。 与 code-as-harness 把外壳作为包裹学生的代码不同,agent-as-harness 把外壳指导转译为“学生原生动作”的监督,从而跨越源外壳与目标外壳在动作空间和可用信息上的差异;适配方式是把工具变成动作配方、学生侧中间件变成审阅中间件、技能与记忆变成诊断标准与干预指导。 论文给出三阶段流程、审阅协议(每次提交 pass/replace、替换须为完整响应、每轮替换预算在 SpreadsheetBench/AppWorld/USPTO 分别设为 5、3、1 与 5)、以及轨迹过滤规则(剔除含 /components/ 路径、审阅工具名等私有痕迹的轨迹,并掩码审阅者视角的推理片段)。

免训练对比中,带适配参考外壳的 agent-as-harness 在六个基准–模型设置上平均 81.1%,高于 meta-harness 的 78.1% 与 mini-SWE-agent 的 68.6%;参考外壳为空时仅 69.2%,说明增益主要来自外壳指导而非“审阅”本身。 论文报告 agent-as-harness 相对 code-as-harness 平均相对提升 +27.6%,并指出代码外壳把“模型应如何行动”的假设固化下来,模型能力变化后假设会过时,而 agent-as-harness 把适配移到推理时。 Table 1 覆盖 DeepSeek-V4-Pro 与 GPT-5.6 Sol 在 SpreadsheetBench、AppWorld、USPTO 上的结果;两种 agent-as-harness 条件下学生与驾驭智能体为同一模型,因此增益不能来自更强的监督模型。附录 F 补充:相对优势与模型能力相关,在 GPT-5.6 Sol 上 +1.0%、DeepSeek-V4-Pro 上 +4.0%,而在 DeepSeek-V4-Flash 上 -1.0%、Qwen3.6-35B-A3B 上 -12.0%。

蒸馏实验中,Harness-Zero 让 Qwen3.5-9B 在仅保留最小目标外壳时宏平均从 23.3% 升到 44.3%(+21.0 点,相对 +90.1%),超过基座模型仍挂载进化外壳的 41.7%;行为分析显示蒸馏模型在 28 个外壳专属模式上平均恢复 82.3%。 消融显示监督来源比“更强示范”更关键:直接微调 GPT-5.6 Sol 轨迹仍停在 12%,教师挂载进化外壳的轨迹降到 3%,学生挂载进化外壳的轨迹回到 12%,空参考外壳的审阅为 11%,给出 oracle 答案的审阅为 15%,而 Harness-Zero 达 30%;采集成功率并不预测蒸馏价值(oracle 条件采集成功率 98.6% 却只得 15%)。 Table 2 与 Table 3 均从 Qwen3.5-9B 出发、使用同一 500 任务采集集与训练配方、在目标外壳下评测 2 epoch 检查点;Table 4 的恢复率只在“基座模型在进化外壳下出现、在目标外壳下从不出现”的支持任务上计分,基座模型按构造为 0%。

启示与展望

该结果面向在固定最小目标外壳(mini-SWE-agent 风格、单一 Bash 执行工具)下部署的学生模型,适用于需要把领域外壳的程序性行为内化到权重的场景;论文明确说这并不取消外壳的必要性,而是缩小外壳必须提供的范围,并预期随着外壳蒸馏改进,一个最小外壳即可够用。方法需要一次性的外壳进化(本文用 Kimi K3 在 Kimi Code 下做三轮技能引导进化)与外壳适配,以及一个足够强的驾驭模型来采集训练轨迹;采集阶段每步至少两次模型调用,USPTO 上 agent-as-harness 平均每试次 237.2 秒,约为 mini-SWE-agent 的 100.1 秒,这一开销在蒸馏后消失。对读者而言,可直接复用的是“审阅—最小替换—SFT”的流程与组件适配映射(工具→动作配方、中间件→审阅中间件、技能/记忆→诊断标准与失败模式),以及把外壳规则翻译成轨迹检测器来度量内化的做法。

论文自身列出的开放问题包括:方法依赖有能力的驾驭模型,弱模型下审阅可能有害(附录 F 中 Qwen3.6-35B-A3B 上相对 meta-harness 为 -12.0%,且替换了 66.0% 的被审阅步骤却净有害);SFT 可能无法完全内化进化外壳编码的深层领域知识,USPTO 上蒸馏模型 30.0% 仍低于挂载外壳的 38.0%;部分外壳机制(如上下文管理)无法直接表达为学生响应。未来方向包括:驾驭智能体面临的反事实预测问题,可训练更强的智能体世界模型;当前逐提案审阅且只能整条通过或替换,可用代理信号选择性触发审阅并支持 token 插入、潜空间引导等更细粒度干预;每次替换在同一状态上配对了一个被拒与一个更优响应,偏好学习可利用被响应级 SFT 丢弃的比较信号。读者还应留意:蒸馏实验以 Qwen3.5-9B 为主、报告单次运行的 pass@1,跨基座模型与跨域的稳定性仍需更多证据;本文为全文阅读,但图表数值以正文与附录表格所载为准。

来源