ASPIRE 用行为图与探索-利用双专家发现智能体提示注入漏洞,在 AgentDojo 上达到 54.1% 攻击成功率
核心概要
ASPIRE 是一个面向 LLM 智能体的开放式提示注入红队框架,它维护一张不断演化的智能体安全行为图,用探索与利用两类专家提出以后果为中心的测试骨架,再由实现器生成具体注入载荷与触发查询,并用轨迹证据更新图与跨运行策略记忆;在 AgentDojo 与 AgentDyn 上,它把攻击成功率提升到最高 54.1%,同时覆盖更多后果、注入方法、环境与行为路径。
Figure 1 : Comparison of problem setups between ASPIRE and existing prompt-injection evaluation paradigms.
arXiv深度剖析
把智能体提示注入红队从“优化注入字符串”重新表述为“开放式漏洞发现”:漏洞被定义为一条可被利用的影响路径,即不可信内容进入工作流、影响中间决策并最终到达非预期动作或状态变更。 此前基准与黑盒、灰盒方法通常在目标后果与环境固定后优化注入内容,漏洞假设本身是预先给定的;该工作把搜索对象扩展到后果、方法、环境与行为路径的组合。 论文以问题设定与形式化描述给出这一重新表述,并在实验中用后果–机制–环境三元组作为唯一漏洞的计数单位来支撑该视角。
ASPIRE 以智能体安全行为图为中枢,节点涵盖注入环境、访问工具、观察、推理模块、动作工具、持久状态与最终输出,边记录信息与控制流,并为每条边维护执行证据与状态(未测试、支持、阻断、条件、饱和)。 该图不是重建智能体真实内部计算,而是表示红队方当前的实证知识,从而把“下一步测什么”变成可追踪的决策。 消融实验显示,去掉行为图后攻击成功率完全塌缩到 0.0%,说明没有交互面的拓扑模型,LLM 无法自发找到有效的多步攻击路径。
探索专家与利用专家分工协作:探索专家面向未确认后果、测试不足的环境与不确定路径扩展前沿,利用专家通过补全部分轨迹、复现已确认漏洞并检验其跨路径、环境、方法迁移来验证与泛化。 测试骨架与具体载荷构造被分离,由独立的实现器生成注入载荷与良性触发查询,避免搜索退化为局部提示改写。 仅用探索专家得到 81 个唯一骨架与 40.0% 攻击成功率,仅用利用专家得到 45.5% 攻击成功率但只有 24 个唯一漏洞,双专家组合达到 96 个唯一漏洞与 52.4% 峰值攻击成功率;去掉专家模块后平均攻击成功率从 52.4% 降到 34.7%(AgentDojo)、从 37.8% 降到 25.2%(AgentDyn)。
跨运行策略记忆把搜索中的转折点提炼为可迁移经验,每条记忆包含类别、极性、上下文、主张与行动,并在后续运行中按当前图状态、失败阶段与候选测试检索、保留、削弱或抑制。 记忆存储的是如何导航漏洞发现(何时切换注入面、修复触发、比较方法或放弃饱和路径),而不是可重放的攻击载荷。 在四种攻击模型上,长期记忆带来一致的正向提升,AgentDojo 平均绝对攻击成功率增益 +6.9%,AgentDyn +7.1%;轻量骨干受益明显(Gemini-3.5-Flash-Lite 分别 +8.1% 与 +8.5%)。
启示与展望
该工作面向构建者侧的漏洞发现,适用于与外部环境、工具和记忆交互的 LLM 智能体,实验在 AgentDojo 与 AgentDyn 的可执行环境上进行,覆盖银行、Slack、旅行、工作区、DailyLife、GitHub 与购物等域,并同时考察 ReAct 与 planner–executor 两种架构。其产出是漏洞报告与漏洞地图:报告重建从注入环境到目标后果的证据链并归因行为原因,地图组织已测试的后果、方法、环境与行为路径组合,区分已确认、部分、失败与未测试的假设。对读者而言,这提供了一套可复用的诊断视角:把注入视为影响路径而非孤立字符串,并据此评估自身智能体的入口面与动作面。
需要留意的是,失败尝试在文中不被视为安全的证明,其停滞点只指示影响被中断的位置以及仍需测试之处;因此漏洞地图的空白区域应作为待查项而非结论。覆盖度在不同基准上并不一致,动作工具覆盖在 AgentDojo 为 92.6%,而在 AgentDyn 降至 42.9%,文中将其归因于动态环境中较深的顺序依赖与前置条件约束。多样性方面,较弱骨干出现后果维度的模式塌缩(归一化熵降至 0.593,Simpson 指数 0.475),提示搜索均衡性可能随模型能力变化。此外,防御下的结果中个别域出现加固后攻击成功率高于未防御基线的情形,文中给出注意力锚定与信号驱动专家适应两种可能解释,尚待进一步验证。文中部分公式与图表在解析文本中未完整呈现,若需精确复现指标定义与算法细节,仍需查阅原文附录。
