跳到主要内容
返回时间线
arXiv来源发表:

SafeActBench用656个案例追踪工具智能体的证据到行动链,发现静态判断强而交互执行弱

核心概要

研究者提出SafeActBench,包含656个案例、覆盖六个运营领域与五种协议,用来源绑定的证据账本和确定性轨迹评估器检查工具智能体在行动前是否已建立所需证据;在十种模型–执行框架组合上,静态行动判断可以很强,而交互式执行明显更弱,失败常源于调查不完整或过早行动,一旦证据齐备,单步执行通常可靠,多步工作流则还暴露出未解决的前置条件与执行不完整。

AI-generated editorial illustration: From Evidence to Action: How Tool-Using Agents Fail

深度剖析

论文把有后果的工具使用形式化为可观测的“证据到行动链”,要求每个改变外部状态的动作在执行前已有针对正确实体与状态的证据,并区分信息收集调用与有后果动作。 既有交互式评测多关注任务是否完成、策略是否被遵守或是否过度信任环境观察,本文把“行动前证据是否已建立并绑定到该动作的实体与状态”作为独立评估对象。 该框架由SafeActBench的656个案例实例化,案例规格与评估器经作者参考解全部通过、人工审计与负对照检验,评估完全基于可观测轨迹且不使用LLM评判。

在十种模型–执行框架组合上,静态行动判断与交互式执行之间存在明显落差:多个配置在Legacy协议上超过96%,但在V1–V3上表现差异很大。 这一落差在固定案例身份后依然存在:三个配置在同一批V1案例上静态准确率至少95%,而交互式ECS最高仅52%。 主评测每个案例–配置组合运行三次,主评测无基础设施失败、覆盖率100%;配对比较使用案例级自助法置信区间。

失败多发生在执行之前:V0上调查不完整率(BSR)为21.7%–62.9%,V1上有行动尝试的episode中过早行动率(PAR)为37.0%–66.9%;而在证据完成后,单步执行的条件成功率(CAS)在十个配置中有九个为93.2%–100%。 这表明聚合成功率掩盖了调查、证据绑定与行动时机等上游环节的差异,而非单纯的执行能力不足。 诊断指标由确定性评估器在可观测轨迹上计算,每个episode只计一次,并在三次重复内分别计算后取等权平均。

受控干预显示,撤回关键记录使行动概率下降37.2–45.2个百分点,但智能体仍在46.5%–53.5%的已完成撤回episode中行动;请求方声称缺失记录已核实可把行动数降到6/43、10/43、6/43,其降幅大于仅呈现证据包。 这说明智能体对请求方的冲突性声明比对证据缺失本身更敏感,且额外检索与行动克制并不必然同步。 干预在43个V1案例的冻结队列上进行,使用配对案例自助法置信区间;作者明确指出这些是行为反应测量,而非智能体内部解读。

启示与展望

该工作面向研究工具智能体证据到行动行为的研究者与评测设计者,适用于有状态、可观测轨迹的合成任务环境,覆盖客户与政策、工程与基础设施、法律与金融、研究助理、智能家居控制与医疗运营六个领域。其证据账本与确定性评估器可用于在部署前定位失败环节,并支持把干预扩展到多步协议、在每个行动检查点变化证据。作者明确说明这些领域是受控设置,结果不应被解读为对相应真实世界系统安全性的认证。

分析刻画的是可观测支持而非模型内部依赖,因此“证据已建立”与“模型实际依据该证据”之间仍有距离;作者把干预扩展到多步协议、在每个行动检查点变化证据列为自然的下一步。受控干预在43个V1案例的冻结队列上进行,撤回与矛盾条件的配对样本更小,且未行动不被计为正确拒绝。执行框架比较中,原生与Inspect运行在不同时间采集、超时与恢复历史不同,限制了把差异单独归因于执行框架。补充研究中SCGR-Select在不同配置与协议上效果方向不一,且部分比较使用不同案例集与覆盖率,需在各自案例范围内解读。此外,本次材料为全文文本,图表数值以文本与表格形式给出,若需核对图中曲线细节仍需查阅原文图表。

来源