SEAD把工具型智能体的攻防重写为部分可观测状态控制:DART把语义攻击成功率抬高18.8–35.9个百分点,SAGE把可执行攻击成功率从48.0%压到4.0%
核心概要
该工作把工具型语言模型智能体的攻击与防御统一表述为部分可观测状态控制问题(SEAD),据此提出用执行反馈做树搜索的攻击方法DART与可在执行前做只读状态调查的防御方法SAGE,并在187个恶意任务、四个目标模型上报告DART在语义与可执行两种判据下均超过基线18.8–35.9个百分点,SAGE在记录轨迹上保留95.79%的良性轨迹、拦截92.73%的有害路径,在线评估中把DART的可执行攻击成功率从48.0%降至4.0%。
深度剖析
论文把智能体安全形式化为共享执行循环中的部分可观测状态控制:攻击者提供指令、目标智能体选择具体工具动作、防御者在动作生效前决定是否放行,危害被定义为执行所到达的状态而非单条回复。 以往攻击研究多在对话层面构造,防御研究多从各自角色目标出发;这里把攻击与防御的设计要求共同从持续状态效应、角色特定的部分观测和执行反馈中推导出来。 论文给出状态转移、观测投影、危害状态谓词与“危害使能转移”的形式化定义,并说明当可见历史与两种需要相反决策的状态都相容时,仅凭历史无法判定,这构成后续方法的动机。
DART把有害目标分解为局部看似合理的步骤,用真实工具执行反馈在已执行轨迹前缀上做树搜索,并以可执行校验器加两个LLM启发式评分来评估节点价值。 与直接请求、固定多轮分解(MTA)、合成工具上下文(STAC)和对话式意图劫持相比,DART让实际执行结果而非预期步骤决定下一步指令与分支选择。 在187个任务、四个目标模型上,DART在语义与可执行两种判据下均为最高,语义成功率超过各目标最佳基线18.8–35.9个百分点,可执行成功率高出8.1–17.9个百分点;案例显示它在目标连续拒绝后转向另一初始前缀并取得确认成功。
SAGE在放行或拦截每个待执行动作前,可用只读、防御者私有的查询主动获取环境状态证据,并在被拦截后对重新规划的动作再次把关。 相对只做二分类决策的防御器以及StepGuard、TS-Guard、Safiron等已发布检查点,SAGE把“先调查再决定”作为安全机制的一部分,而非仅依赖可见历史。 在75任务子集的记录轨迹上,SAGE良性全通过率95.79%、精确拦截率34.55%、拦截率92.73%,调和分数在所列防御器中最高;相对微调二分类器,它以4.21个百分点的良性效用换取65.45个百分点的有害拦截提升。
在线攻防评估显示,拦截会改变后续轨迹,因此保护效果必须在干预后的延续上衡量;SAGE在四种攻击方法下都降低成功率,并迁移到训练时被排除的PostgreSQL与Web域。 论文区分固定轨迹评估与在线评估,前者隔离单次决策,后者允许攻击者依据拒绝反馈改写计划,从而检验防御是否只是推迟而非阻止危害。 在线评估中SAGE把DART的语义成功率从65.3%降到10.7%、可执行成功率从48.0%降到4.0%;在30个PostgreSQL/Web任务上把语义成功从20降到3、可执行成功从9降到1;案例显示早期拒绝并不保证最终安全。
启示与展望
该框架面向工具中介的执行,即后果性动作经过执行前关卡,且状态调查使用只读、防御者私有的查询;实验覆盖Filesystem、Terminal、PostgreSQL、Web四个工具域,攻击效果在四个目标模型上评估,防御评估以GPT-5.6 Luna为目标,PostgreSQL与Web被排除在防御者微调之外。对希望构建或评测执行前把关的读者,这提供了可复用的数据构造方式(受控初始状态、可重放工具环境、任务级可执行检查)与两类互补指标:固定轨迹上的良性保留与拦截时机,以及干预后延续上的在线成功率。
并发进程、复合动作以及助手输出本身造成的信息泄露被列为需要扩展干预接口的方向;防御的在线评估集中在单一目标模型,更广的目标覆盖与对搜索、调查各组件的受控消融被列为后续工作。此外,本文所依据的文本为完整正文与附录,但图表以表格形式呈现,若读者需要逐图核对拦截时机分布等细节,仍需回到原文图表。
