arXiv 2026年10月6日作者将验证自主等级(VAL,L0 至 L5)应用于 22 项 LLM 智能体安全防御,并在等预算下对比 VAL 引导栈(确认门 + schema 沙箱)与主流直觉栈(提示加固 + 关键词过滤),在 50 个场景、12 种攻击变体及自适应/白盒/PAIR 升级下发现:VAL 栈在 1.000 良性成功率下保持 0.000 攻击成功率,而直觉栈虽达 0.000 ASR 却使全部良性动作失效,且在攻击面加硬的测试台上其零值漂移(0→1.9%→6.2%),VAL 栈则在其 ODD 内保持(0→0→0),唯一突破为已披露的 ODD 外口令缺口(0.5%)。作者将验证自主等级(VAL,L0 至 L5)应用于 22 项 LLM 智能体安全防御,并在等预算下对比 VAL 引导栈(确认门 + schema 沙箱)与主流直觉栈(提示加固 + 关键词过滤),在 50 个场景、12 种攻击变体及自适应/白盒/PAIR 升级下发现:VAL 栈在 1.000 良性成功率下保持 0.000 攻击成功率,而直觉栈虽达 0.000 ASR 却使全部良性动作失效,且在攻击面加硬的测试台上其零值漂移(0→1.9%→6.2%),VAL 栈则在其 ODD 内保持(0→0→0),唯一突破为已披露的 ODD 外口令缺口(0.5%)。同一份零:VAL 分级框架显示相同 ASR 背后是不同保证,VAL 引导栈在 0.000 攻击成功率下保持 1.000 良性成功率作者将验证自主等级(VAL,L0 至 L5)应用于 22 项 LLM 智能体安全防御,并在等预算下对比 VAL 引导栈(确认门 + schema 沙箱)与主流直觉栈(提示加固 + 关键词过滤),在 50 个场景、12 种攻击变体及自适应/白盒/PAIR 升级下发现:VAL 栈在 1.000 良性成功率下保持 0.000 攻击成功率,而直觉栈虽达 0.000 ASR 却使全部良性动作失效,且在攻击面加硬的测试台上其零值漂移(0→1.9%→6.2%),VAL 栈则在其 ODD 内保持(0→0→0),唯一突破为已披露的 ODD 外口令缺口(0.5%)。作者将验证自主等级(VAL,L0 至 L5)应用于 22 项 LLM 智能体安全防御,并在等预算下对比 VAL 引导栈(确认门 + schema 沙箱)与主流直觉栈(提示加固 + 关键词过滤),在 50 个场景、12 种攻击变体及自适应/白盒/PAIR 升级下发现:VAL 栈在 1.000 良性成功率下保持 0.000 攻击成功率,而直觉栈虽达 0.000 ASR 却使全部良性动作失效,且在攻击面加硬的测试台上其零值漂移(0→1.9%→6.2%),VAL 栈则在其 ODD 内保持(0→0→0),唯一突破为已披露的 ODD 外口令缺口(0.5%)。