APEX 把间接提示注入防御移到执行边界:六个基准中五个攻击成功率降至 0%,第六个为 0.56%
相关研究与后续进展核心概要
该工作提出 APEX,把间接提示注入防御从识别攻击模式转为在执行边界检查每个拟执行效果:执行前把用户授权编译为一份授权契约,WRAP 依据契约与运行时证据只放行可重建授权的效果,PLANT 在契约认可的依赖上放置探针使未被认可的信息使用在提交前自我暴露;在六个基准、13 个基线上,APEX 在五个基准达到 0% 攻击成功率、第六个为 0.56%,并在三类能力单元的三种自适应攻击下保持 0%。
Figure 1: Left: injections arrive through many carriers and compositions, but become consequential only at the execution boundary, where they appear as unauthorized actions or unendorsed uses of information. APEX actively checks each proposed effect there. Right: security ( 1 − ASR 1-\mathrm{ASR} ) against attack utility on one benchmark per capability unit; APEX (star) sits at the top right of each panel, and attains the lowest ASR with high utility on all six benchmarks, 0 % 0\% on five.
arXiv深度剖析
论文把边界风险按任务认可度拆成两类:效果本身未被授权,或效果虽被授权却使用了任务未认可的运行时信息;两类检查被集中到同一个执行边界。 以往防御各自依赖一种信号——内容可分离性、行为与任务的对齐、预先写下的策略、从运行轨迹恢复的溯源标签,或提前放置的诱饵;APEX 改为以任务授权为唯一判据,不随攻击载体扩展。 该拆分在威胁模型中给出,并在附录 B 以授权可靠性引理与任务级定理形式化;实验上以六个基准、13 个基线的对比支撑。
WRAP 从拟执行效果反向追踪契约、再从运行时证据正向求解,只有当动作与每个参数都能被契约和收据重建时才放行,且不传播安全标签。 与策略类防御不同,契约不仅说明哪些效果被允许,还说明参数可以沿哪些依赖被确定;与污点类防御不同,它不要求标签在模型改写中存活。 消融显示移除 WRAP 后 ASB-OPI 的攻击成功率从 0% 升至 57.60%,接近未防御的 59.80%;在 MCPTox 与 SkillInject 上分别升至 4.15% 与 2.22%。
PLANT 在契约认可的依赖上放置带一次性令牌的观测、依赖与基座探针,令牌出现在拟提交参数或已释放输出中即构成未被认可使用的证据。 探针位置由契约推导而非启发式决定,且探针替换的是身份承载值本身,因此携带它就把令牌带到边界,丢弃它就使注入失去着力点。 在 5,486 个攻击案例中至少部署一个探针的比例为 80.1%,部署的 10,193 个探针中 779 个(7.6%)产生门控证据;全部案例中 PLANT 未产生误报。
安全续行在拒绝后从已证绑定重建状态,先尝试确定性修复,不可行时把净化后的状态交给新智能体重规划,否则中止分支,且不修改契约。 恢复过程由非智能体控制器执行,只重放已证值与作废证据,因此恢复改变执行路径而不扩大任务授权。 移除续行后 ASB-OPI 的攻击效用从 85.05 降至 62.20、MCPTox 从 75.52 降至 48.15,而安全收益很小;ASB-OPI 上 2,040 个案例中一次重规划使除 11 个之外全部回到用户任务。
启示与展望
该结果面向通过已注册接口产生外部后果的操作,适用于工具、MCP 服务器与技能三类能力单元及其组合;绕过注册接口的效果或状态变更不在保证范围内。防御方需要先编译出忠实于用户请求的授权契约,且能力单元需一次性注册接口、I/O 模式、外部效果与可探测表面。对希望在不重写各能力单元安全逻辑的前提下统一中介调用的部署者,这一边界检查可直接复用;对需要长程任务或有意把决策委托给外部内容的任务,则需要先明确谁可提供指令、可授权哪些动作。
授权契约的保真度是保护强度的前提:编译发生在读取任何不可信内容之前,因此契约偏差只会阻塞合法工作而不会放行危害,但含糊或欠指定的请求可能产生过严的契约。PLANT 的覆盖依赖部署与探针保持,在 MSB(41.2%)与 SCR-Bench(37.5%)上可放置探针的案例比例明显低于其他基准,无安全放置时由 WRAP 单独约束。残余风险是效果与信息依赖都被任务认可却仍有害的情形,例如 SkillInject 上 0.56% 的那一例:攻击停留在被授权效果内、不携带可传递的身份,需要更细的意图规格或任务特定安全策略。长程任务在理论上可扩展,但复杂目标与条件分支的编译准确性仍需专门的长程安全基准来评估。
