跳到主要内容
返回时间线
arXiv来源发表:

超越结果:面向高效智能体基准评测的双视角关系学习

核心概要

该工作分析五个智能体基准的大规模执行轨迹,从十二个可观测统计量中筛选出六个与最终成绩系统性相关的过程信号,并提出 DualViewEval,同时建模结果关系与过程关系来学习固定规模的最小子集并预测全基准分数,在五个基准上均取得最佳结果,仅用 20 个任务即在 APEX-Agents 与 BFCL 上实现 24×–40× 压缩,相对最强竞争者降低 MAE 14.5%–28.2%,并在 SWE-bench Verified 上相对 EssenceBench 将 Kendall's τ 提升最多 7.2%。

Source-provided article image: Beyond Outcomes: Dual-View Relational Learning for Efficient Agent Benchmarking
Figure 2 ·

Figure 2 : Association between automatically extracted process measurements and agent performance. (a) Within-benchmark Spearman correlations for the selected six measurements (purple) and six reference statistics. (b) Mean correlation across benchmarks. (c) Distributions of the selected measurements for low, middle, and high scoring BFCL models.

arXiv

深度剖析

论文从大规模智能体轨迹中提炼出六个基准无关的过程度量:智能体步数、工具失败率、工具类别熵、验证工具率、必需写操作执行、读–写–验证闭环。 此前压缩方法主要建模任务–模型最终分数分布中的冗余,而该工作通过跨基准相关性分析从十二个候选统计量中筛选出六个可自动可靠提取且语义冗余有限的过程信号,把执行行为纳入表示。 基于五个具有开放轨迹的智能体基准的大规模执行轨迹分析,报告了这些度量与全基准分数的系统性关联,并给出低、中、高分组 BFCL 模型过程分布差异。

提出 DualViewEval,一个端到端双视角框架,对每个任务同时构建结果关系矩阵与过程关系矩阵,融合为智能体核并送入 Kernel Ridge 分数预测器,用直通硬 Top-K 门保持最小子集规模精确。 与 SparseEval 等主要建模结果矩阵列间关系的方法不同,该框架同时利用智能体层面的共享结构与执行过程,并将任务选择与下游预测目标耦合在单一反馈回路中。 方法在五个基准、三个最小子集规模、十次划分下报告均值与标准差,并配有结果/过程关系矩阵消融、选择器消融、预测架构消融与预算扫描。

在五个智能体基准上,DualViewEval 在全部数据集取得最佳结果;仅用 20 个任务即在 APEX-Agents 与 BFCL 上实现 24×–40× 压缩,相对最强竞争者降低 MAE 14.5%–28.2%。 相对最直接可比的结果驱动预测基线 SparseEval,跨基准平均降低 MAE 30.5%–45.1%,平均 Kendall's τ 提升 0.089–0.115;在 APEX-Agents 最紧预算下 MAE 降低 34.3%、τ 提升 0.100。 十次划分的均值±标准差结果,覆盖 BFCL、τ²-Bench、Terminal-Bench 2、SWE-bench Verified、APEX-Agents,共 1,983 个任务、262 个智能体配置、132,387 个结果对。

所选最小子集能揭示智能体之间的能力差异,且过程权重 γ 随基准自适应,训练成本低于 SparseEval。 除分数预测外,压缩后的子集保留了可诊断的行为证据;学习到的 γ 在不同基准上分布不同,固定 γ 扫描也显示中间权重通常给出最佳误差–排序权衡。 报告了 APEX-Agents 与 SWE-bench Verified 的聚合过程画像表、γ 分布图、训练数据比例实验,以及约 4.2×–8.3× 的训练时间加速。

启示与展望

该结果面向需要频繁评测智能体、且能获取执行轨迹的评测场景:方法依赖可自动解析的轨迹与工具调用记录,适用于 BFCL、τ²-Bench、Terminal-Bench 2、SWE-bench Verified、APEX-Agents 这类可对齐结果与轨迹的基准。它使研究者与工程团队能在固定任务预算下估计全基准分数与排序,并借助所选子集观察智能体在工具使用、验证与写操作闭环上的行为差异;对无法获得轨迹或工具调用结构的评测设置,其过程视角的适用性需要另行验证。

读者仍可关注:过程度量在轨迹格式差异较大或工具调用解析不完整时的提取稳定性;学习到的过程权重 γ 在不同基准上取值不同,说明结果与过程的最优平衡依赖具体基准,迁移到新基准时需要重新校准;留出模型族实验仅在 APEX-Agents 的 Qwen 家族上进行,其他模型族与基准上的泛化程度仍是开放问题;此外,本文为全文阅读,但图表以文字形式呈现,部分图形细节(如 γ 分布与效率分析的具体数值)无法从文本中完整核对。

来源