跳到主要内容
返回时间线
arXiv来源发表:

SHarP 用单模块消融的显著性剪枝智能体 harness:四个 harness 在性能相当下至少降低 10% token 成本,OpenHands 在 GAIA 上从 29.44% 升至 35.00%

核心概要

该工作提出 SHarP,把智能体 harness 中的工具、指令与支撑机制视为可单独禁用的模块,用单模块消融估计每个模块对任务性能与 token 成本的显著性,再按效率导向或性能导向规则剪枝;在 OpenHands/GAIA、PaperQA2/LitQA2、LIFE-harness 的 airline 与 retail、JIT agentfold/DeepPlanning-Shopping 五个设置上,剪枝后多数配置保持相近性能,四个 harness 均实现至少 10% 的 token 成本下降,其中两个在降本同时提升任务表现。

Source-provided article image: SHarP: Saliency-based Pruning of Agent Harnesses
Figure 1 ·

Figure 1: Overview of SHarP ’s efficiency-oriented pruning. Single-module ablations estimate performance and efficiency saliency, which determine the protected module set (green) and pruning order, respectively. Pruned configurations and an all-pruned baseline are evaluated for task performance and token cost.

arXiv

深度剖析

论文把 harness 剪枝形式化为可操作的流程:先按实现边界把 harness 划分为可单独禁用的模块(注册工具、按标题或标签识别的指令块、检索到的技能、独立处理机制),并明确每个模块“被剪掉”的具体含义,例如剪掉搜索工具即从提示中移除该工具及其说明并禁止访问,剪掉历史摘要机制即始终保留完整历史。 此前关于 harness 膨胀与效率的工作多停留在“增加机制未必提升性能”或限制上下文与工具暴露,缺少对异构模块(工具、指令、支撑机制)统一量化冗余并移除的系统做法;该工作把神经网络剪枝的显著性思路迁移到 harness,并给出模块划分与禁用语义的明确约定。 方法层面给出四步流程(模块识别、显著性计算、显著性引导剪枝、剪枝评估),并在附录 A.1 逐条列出各 harness 的候选模块、功能与禁用说明,使流程可复现。

显著性由单模块消融估计:对每个模块禁用它并运行,记录任务得分与 token 成本,与同一任务上所有单模块消融的中位数比较,得到性能与效率两个差异项,再用单侧配对 t 检验得到 p 值作为性能显著性与效率显著性;每个模块只需一次额外评估。 相比穷举不同剪枝组合,这种估计方式把评估成本压到每个模块一次,使剪枝在评估昂贵的智能体场景中可行;同时把“剪掉模块未必省成本”这一与神经网络剪枝不同的性质纳入同一显著性框架。 论文给出差异项、中位数参考、单侧配对 t 检验与自由度、p 值计算,并说明配对差异恒定时(标准差为零)的计算约定;附录 A.4 报告了各模块消融的任务得分、token 成本与 p 值。

两种剪枝规则共享同一组显著性估计但角色互换:效率导向剪枝先保护对性能关键的模块,再按效率显著性从高到低移除未保护模块;性能导向剪枝对称地保护对效率关键的模块,再按性能显著性排序移除。 把“保护集 + 排序移除”的剪枝预算机制引入 harness,使同一套显著性估计可以按不同目标生成一系列剪枝配置,而不是只给出单一压缩结果。 在 JIT agentfold/DeepPlanning-Shopping 与 LIFE-harness retail 上以每任务一次试验比较两种策略:前者性能导向在某一配置达到 82.5% 匹配率、token 成本较全量下降 5.9%,效率导向在另一配置达到 76.2% 匹配率、token 下降 39.0%;retail 上效率导向在某一配置达到 87.5% 成功率,性能导向在另一配置把平均 token 成本降低 21.2%、成功率 70.0%。

跨五个设置的主要结果显示 harness 存在大量冗余:许多剪枝配置保持相近的观测性能并降低 token 成本,四个 harness 均实现至少 10% 的 token 成本下降,其中两个在降本同时提升任务表现;但冗余程度随 harness 与任务域变化,剪得过多会损害性能,剪枝也可能反而增加成本。 此前缺少对 harness 冗余程度的系统量化;该工作用留出验证集上的剪枝配置序列给出经验证据,并指出剪枝收益并非单调。 OpenHands 在 GAIA 上剪掉 27 个模块中的 24 个时成功率最高,从全量的 29.44% 升至 35.00%,但全部 27 个模块剪掉后降至 14.44%;PaperQA2 在全量配置下性能最高;LIFE-harness 在 airline 全剪配置下性能小幅下降、retail 略有上升;PaperQA2 剪掉 15 个模块的配置与 JIT agentfold 全剪配置的 token 成本都高于各自全量 harness。

启示与展望

该结果面向需要在固定模型下降低智能体 token 成本的工程与研究场景:使用者可对自有 harness 做模块划分、单模块消融与显著性估计,再按效率导向或性能导向规则生成剪枝配置序列,并在留出验证集上比较。论文的评估以 Qwen3.5-122B-A10B 为统一基座模型,覆盖 OpenHands/GAIA、PaperQA2/LitQA2、LIFE-harness 的 airline 与 retail、JIT agentfold/DeepPlanning-Shopping;模块划分遵循既有实现边界,高度耦合的元素(如工具与其使用说明)合并为单一模块。剪枝配置的收益按 harness 与任务域不同,效率导向与性能导向策略在 DeepPlanning-Shopping 与 retail 上各占优势,因此适用时应以目标 harness 与目标域上的验证结果为准。

剪枝策略对比在 JIT agentfold 与 LIFE-harness retail 上仅使用每任务一次试验,而主要结果默认三次试验,因此两种策略的相对优劣在不同试验预算下是否稳定,值得在自有设置中复核。模块划分由人工按实现边界完成,不同划分粒度可能改变显著性估计与可剪范围。论文报告的是留出验证集上的观测性能与 token 成本,token 计数覆盖失败尝试但不衡量执行时间;PaperQA2 的离线语料预处理与索引构建不计入 token 成本。此外,剪枝可能移除帮助智能体高效终止或筛选证据的功能,导致成本上升,因此剪枝后的配置仍需在目标域上验证其终止行为与证据处理路径。

来源