跳到主要内容
返回时间线
arXiv来源发表:

SRFT 让 LLM 智能体从自身失败中学习,AgentDojo 攻击成功率从 7.59% 降至 1.26%

核心概要

该工作提出自反思微调(SRFT):在干净专家轨迹中注入攻击指令,让智能体在受攻击上下文中采样自身可能失败的动作,再由专家模型生成对比安全与最优动作的结构化反思推理,用该反思监督微调智能体;在 Llama-3.1-8B-Instruct 与 Qwen3-8B 上实例化为 SR-Agent,AgentDojo 攻击成功率分别从 7.59% 降至 1.26%、从 16.97% 降至 1.05%,并在 RL-Hammer 自适应攻击下保持较低攻击成功率。

Source-provided article image: Self-Reflection Fine-Tuning: Enhancing Agent Security against Prompt Injection Attacks from Failure Experience
Figure 1 ·

Figure 1: Left: Supervised fine-tuning learns from fixed defensive patterns, which may become ineffective when encountering unseen attacks. Right: Self-reflection fine-tuning learns from failure experiences, enabling it to handle a broader range of attacks and identify previously unseen ones.

arXiv

深度剖析

SRFT 把提示注入防御从模仿专家动作转为从自身失败经验中学习:先向干净专家轨迹注入攻击指令,再让目标智能体在受攻击上下文中采样动作,暴露其跟随注入的失败案例。 相较依赖静态专家轨迹或偏好优化的既有对齐方法(如 StruQ、SecAlign、Meta-SecAlign),该框架让智能体接触自身在对抗条件下的真实失败行为,而非仅模仿预定义防御模式。 训练数据来自 TOUCAN 的 5 个平台,共 402 个用户任务、38 个恶意注入任务、3698 条轨迹与 22339 个助手步骤,38% 的工具观测携带注入;每个助手步骤采样 3 个响应。

专家模型生成的三段式自反思推理(上下文与原始目标总结、注入识别与恶意意图解释、安全感知动作分析及反事实后果预测)作为监督信号,使智能体学会解释为何最优动作优于被劫持动作。 该反思以智能体自身采样动作为对比对象,同时提供对最优动作的正向论证与对不安全候选的负向证据,区别于仅做模式抑制或偏好排序的防御。 反思由 Claude Sonnet 4.6 依据注入真值与参考智能体失败生成,平均 396 tokens(中位数 401);训练目标分解为先生成反思、再生成动作两项。

在 AgentDojo 上,SRFT 同时降低攻击成功率并提升任务效用:Llama-3.1-8B-Instruct 的 ASR 从 7.59% 降至 1.26%,Benign Utility 从 27.84% 升至 37.11%,Utility under Attack 从 23.08% 升至 29.08%。 相较同骨干的 Meta-SecAlign-8B,SR-Agent 取得更优的效用—安全权衡,且未牺牲通用能力(MMLU、MMLU-Pro、IFEval、BBH 上与基座相当)。 AgentDojo 含 Banking、Slack、Travel、Workspace 四个环境共 949 条轨迹;Qwen3 家族在 4B 与 8B 两个规模上均复现 ASR 下降。

在 RL-Hammer 自适应攻击下,SR-Agent 的最终 ASR 保持在 20% 以下,而 Meta-SecAlign 超过 60%;消融显示移除失败经验分析使最终 ASR 从 17.0% 升至 65.0%,推理时禁用思考使 AgentDojo ASR 从 1.05% 升至 14.33%。 结果表明鲁棒性并非来自记忆安全响应,而是来自显式推理与基于自身失败的动作分析,这为应对未见攻击提供了经验驱动的学习路径。 RL-Hammer 按目标模型分别训练攻击者,InjecAgent 510 个直接危害案例划分为 310 训练、100 验证、100 测试;Llama 基座最终 ASR 98.5%、Meta-SecAlign 69.5%、SR-Agent 17.5%。

启示与展望

该结果面向工具增强的多步智能体在间接提示注入下的防御,适用于网页、邮件、文档、检索内容或 API 响应等外部观测被污染的场景;训练数据覆盖酒店预订、邮件发送、Windows 命令行、Markdown 下载与 Minecraft Wiki 五个平台,攻击者被假定仅能接触现实可行的攻击面。对希望在不牺牲通用能力的前提下提升智能体安全性的研究者与工程团队,SRFT 提供了可复用的训练配方与开源代码;其反思监督在推理时仅依赖对话本身,无需注入真值或参考智能体的失败样本。

值得继续观察的是:反思监督依赖专家模型生成的注入真值与参考智能体失败样本,这两者在推理时均不可见,模型需仅凭对话复现三段式分析;训练集仅含 38 个恶意注入任务,注入触发来自 750 个模板池,攻击形态的覆盖范围仍是开放问题。此外,AgentDojo 使用默认 important_instructions 攻击,RL-Hammer 评估未做检查点选择,不同攻击配置下的表现有待进一步刻画;将范式扩展到计算机使用智能体或网页智能体仍是未来工作。

来源