两阶段门控审计框架在OpenAgentSafety上以72.8%检出率将LLM审计次数从8.15降至2.33
核心概要
该工作提出一个两阶段LLM智能体监控框架:第一阶段用单事件与轨迹序列规则筛选待审动作,第二阶段由LLM审计智能体结合前置轨迹在执行前判定该动作是否有害,并用优化器LLM联合精炼门控规则与审计提示。在OpenAgentSafety测试集上,调优后的门控审计把平均审计次数从8.15降到2.33、token从47.8k降到14.6k,检出率72.8%(全量审计为81.5%),假阳性率5.9%(全量审计为11.8%);在两个模拟多智能体场景中,框架标记了全部攻击运行,同时把审计token用量降低80%以上。
Fig. 1: Motivating example. (a) The attack succeeds without monitoring. (b) The attack is detected and blocked before completion with monitoring.
arXiv深度剖析
提出两阶段监控框架:确定性门控先筛选待审动作,再由LLM审计智能体在动作执行前结合该智能体前置轨迹给出benign/suspicious/malicious判定,被标记的智能体其待执行动作会被阻断、智能体被终止并生成事件报告。 相对仅依赖预定义规则的护栏与逐动作LLM审计,该设计把语义审计限定在门控选中的动作上,从而在保留语义判断能力的同时压缩审计调用量。 在OpenAgentSafety测试集(149次运行、72个未见任务)上,调优门控配置的审计次数为2.33次/运行、token为14.6k,全量审计为8.15次与47.8k;检出率72.8%对81.5%,假阳性率5.9%对11.8%。
门控规则与审计提示由优化器LLM基于开发集失败案例联合精炼,而非手工编写固定安全策略;优化目标同时权衡真阳性率、假阳性率与相对种子配置的token成本,并要求规则只描述一般行为与结构、不复制失败案例中的文件名或具体取值。 把规则与提示的适配交给数据驱动的迭代优化,使框架能覆盖单条记录难以体现的跨事件模式,例如敏感数据进入上下文后出现外发传输。 训练轮次轨迹显示真阳性率从47.5%升至95.0%,平均审计次数下降62%、token下降54%,假阳性率仅从5.0%升至7.5%;五轮修订均因目标值提升而被接受。
在直接运行的两个模拟多智能体场景(外部攻击者诱导泄露vault key、内部被控智能体诱导执行破坏性命令)中,门控审计与全量审计都在有害动作的执行边界检出全部攻击,且对良性运行无误报。 补充了公开基准仅能回放已发布轨迹的局限,提供来自作者自行运行的多智能体系统的端到端证据。 每个场景各10次攻击运行与10次良性运行;门控审计在场景1降低token 82%、场景2降低86%,门控在场景1触发一次、场景2未触发。
报告了审计模型提供方安全护栏拒绝请求的现象及其对指标的影响:调优门控审计有15/347次请求被拒(4.3%),全量审计有16/1215次(1.3%),拒绝多由轨迹中的有害内容触发;评估中拒绝按检出处理,若忽略拒绝,调优门控审计的真阳性率至少降至55.6%。 把提供方拒绝作为独立现象报告并建议部署时采用fail-closed策略,而不是绕过提供方安全机制。 拒绝计数与按运行分布(门控审计中14次不安全运行、1次安全运行)来自实验记录;忽略拒绝后的数值被作者标注为下界,因为拒绝后审计停止、后续判定不可观测。
启示与展望
该框架面向可记录三类轨迹面(operational、cognitive、contextual)的智能体部署,日志以append-only方式存放在智能体无法访问的隔离环境中,适用于攻击者无法篡改或伪造轨迹来源的设定;威胁模型明确把轨迹篡改排除在范围之外。它同时覆盖白盒(内部攻击者,提示与推理可记录)与黑盒(外部攻击者,仅交互可记录)两种攻击者设定。对希望降低逐动作LLM审计成本的运维方,该结果给出了一条可复现路径:先用确定性门控筛选,再对选中动作做语义审计,并在被标记时阻断待执行动作、终止智能体并留存事件报告。作者指出,假阳性与token的下降在良性轨迹占多数的部署中尤其有价值,前提是72.8%对81.5%的检出率下降可以接受。
调优在验证集上把假阳性率从12.1%升至24.2%,而在测试集上为5.9%,作者将此差异部分归因于验证集51个任务中有32个也出现在训练集、且包含反复触发可疑判定的良性运行,因此标记规则在不同任务分布下的表现仍需观察。忽略提供方拒绝后,调优门控审计的真阳性率至少降至55.6%,且该值为下界,因为拒绝后审计停止、后续判定不可观测。去掉可疑累积准则会把全量审计与调优门控审计的真阳性率分别降至61.7%与63.0%,说明标记规则定义直接决定检出与误报的取舍。作者列出的后续方向包括:加入含合法敏感操作的良性运行、增加场景数量与多样性、控制轨迹生成模型以便更直接比较,以及评估会规避明显线索的更强监控感知攻击者。此外,公开基准评估基于回放已发布轨迹,而非重新运行智能体。
