跳到主要内容
返回时间线
arXiv来源发表:

智能体评测新研究:把智能体当作可配置系统,约54%结果方差来自同一配置的重复运行

核心概要

该研究提出一个包含四项科学任务的新基准,要求编码智能体找到并正确操作已发表的专用模型,并系统考察任务信息、推理、自我验证、时间预算与骨干模型五个配置维度;结果显示约54%的结果方差来自同一配置的重复运行,任务信息的影响超过时间预算与模型规模,且能降低成本、改善校准,而提示智能体自我验证几乎不改变其验证行为,提供专用验证工具则显著改变该行为。

Source-provided article image: Agents Are Systems, Not Models: Rethinking Agentic Evaluation
Figure 1 ·

Figure 1: Architecture of our agentic AI4S benchmark. The agent (center) has access to different specialist models and is evaluated against their published performance (right). By varying the axes of the agent’s configuration within the same task (left), we can systematically study its performance, reliability, and behavior under controlled, repeatable conditions (bottom).

arXiv

深度剖析

智能体性能存在显著的运行间波动:约54%的结果方差来自重复同一配置,而非改变配置。 以往评测通常把智能体本身视为固定对象,只报告成功率、成本、一致性与鲁棒性等指标;该工作把配置选择本身作为方差来源加以量化。 基于四项科学任务的新基准,对五个配置维度进行系统比较,并释放超过18,000条智能体轨迹。

在各项配置中,提供给智能体的任务信息影响最大,超过时间预算与模型规模,同时降低成本并改善校准。 把“告诉智能体什么”与“让它跑多久”“用多大模型”放在同一比较框架下,给出相对重要性排序。 摘要报告跨配置比较结果,并指出信息量与成本、校准之间的同向关系。

配置选择之间存在交互:额外时间只有在智能体拥有足够信息或足够强的模型时才有帮助。 说明时间预算并非独立增益,其收益取决于信息与模型能力这两个条件。 摘要以“additional time helps only when…”的交互形式报告该发现。

基于轨迹的行为分类显示,提示智能体验证答案对其验证行为影响很小,而提供专用验证工具会显著改变该行为。 把“要求某种行为”与“在系统中实现该行为”区分开,指出后者更有效。 依据轨迹层面的行为分类得出,并伴随基准与超过18,000条轨迹的释放。

启示与展望

该工作面向需要编码智能体找到并正确操作已发表专用模型的科学任务场景,适用于研究智能体配置如何影响性能、成本、一致性与校准的读者,包括基准设计者与智能体系统开发者。其结论针对所研究的四项任务与五个配置维度,并伴随基准与超过18,000条轨迹的释放,便于后续在相同设置下复核与扩展。

当前仅依据摘要,无法获知四项科学任务的具体内容、五个配置维度的操作化方式、方差分解的统计细节以及轨迹分类的编码流程;这些细节影响结论在其它任务与配置上的外推程度。此外,摘要未说明不同骨干模型与时间预算的具体取值,读者若要复现或迁移,仍需查阅原文的基准与实验设置。

来源