跳到主要内容
返回时间线
arXiv来源发表:

同一份零:VAL 分级框架显示相同 ASR 背后是不同保证,VAL 引导栈在 0.000 攻击成功率下保持 1.000 良性成功率

相关研究与后续进展

核心概要

作者将验证自主等级(VAL,L0 至 L5)应用于 22 项 LLM 智能体安全防御,并在等预算下对比 VAL 引导栈(确认门 + schema 沙箱)与主流直觉栈(提示加固 + 关键词过滤),在 50 个场景、12 种攻击变体及自适应/白盒/PAIR 升级下发现:VAL 栈在 1.000 良性成功率下保持 0.000 攻击成功率,而直觉栈虽达 0.000 ASR 却使全部良性动作失效,且在攻击面加硬的测试台上其零值漂移(0→1.9%→6.2%),VAL 栈则在其 ODD 内保持(0→0→0),唯一突破为已披露的 ODD 外口令缺口(0.5%)。

AI-generated editorial illustration: The Same Zero: Why Identical ASR Can Imply Different Guarantees in LLM-Agent Security

深度剖析

论文提出并应用验证自主等级(VAL)分类法,将防御按保证来源分为 L0(LLM 自我声明)、L1(确定性规则)、L2(客观真值)、L3/L4(可判定完备性)、L5(不可能),并映射到 22 项智能体安全防御。 此前防御格局密集(提示加固、内容过滤、权限门、沙箱),但没有框架告诉部署者一项防御实际保证什么、保证来自何处;VAL 提供了这一归因层。 摘要报告该分类法可证伪,在冻结卡片上取得 10/10 预测命中(已标注)。

论文报告了首个受控部署价值对比:在等预算下,VAL 引导栈(确认门 + schema 沙箱)达到 0.000 攻击成功率且 1.000 良性成功率。 对比对象是主流直觉栈(提示加固 + 关键词过滤),后者同样达到 0.000 ASR,但使全部良性动作失效,即安全性来自模型行为运气而非结构。 50 个场景、12 种攻击变体、自适应/白盒/PAIR 升级,约 7,000 次测试台调用,另在 AgentDojo/JADE 上约 10,000 次 harness 调用;AgentDojo 银行场景中 VAL 栈为 0.5% ASR、79.7% 效用,未防御为 4.3%。

在攻击面硬度递增的测试台上,直觉栈的零值发生漂移,而 VAL 栈在其运行设计域(ODD)内保持稳定。 这直接支撑论文核心论点:零是结果而非保证,相同 ASR 可对应不同保证。 直觉栈漂移为 0→1.9%→6.2%(JADE 上 n=16),VAL 栈为 0→0→0,唯一突破是已披露的 ODD 外口令缺口(0.5%)。

启示与展望

该工作面向需要为 LLM 智能体防御做部署决策的工程师与安全评估者,适用于论文所测场景、攻击变体与测试台(含 AgentDojo 与 JADE)所界定的运行设计域;VAL 分级本身作为归因工具,可用于盘点防御的保证来源,而 VAL 引导栈的结论以其 ODD 为适用边界,论文亦披露 ODD 外存在口令缺口。

读者仍需关注:VAL 分级在 22 项防御之外的覆盖情况;直觉栈漂移与 VAL 栈稳定性的结论在更多测试台与更长攻击升级下的表现;已披露的 ODD 外口令缺口(0.5%)提示 ODD 边界如何界定与扩展;以及效用与 ASR 的权衡在不同业务场景中的可接受阈值。摘要未给出各场景的完整明细,具体数值分布仍需查阅原文。

来源