AgentTracer 以意图漂移追踪间接提示注入,注入点定位准确率达 94.17%
核心概要
该工作提出 AgentTracer,把间接提示注入视为任务意图漂移,通过恢复工具调用间的隐式决策依赖构建意图驱动执行图,并结合操作知识库构造用户意图授权空间,从异常工具调用反向追踪攻击链;在 AgentDyn 与 InjecAgent 日志并混入 1800 条正常请求、9000 条无注入后台工具调用的历史日志池上,取得 94.17% 注入点准确率与 93.56% 路径精确率,注入点准确率较现有方法提升 18–54%。
Figure 1 . An Example of an Indirect Prompt Injection (IPI) Attack. The malicious instruction induces an attack chain interleaved with user-authorized tool calls. An injected release-page instruction causes SSH-key registration, email retrieval, account verification, and memory clearing. Existing tracing strategies recover incomplete or noisy explanations.
arXiv深度剖析
将间接提示注入追踪形式化为任务意图与工具调用之间的细粒度对齐问题,并提出意图驱动执行图(IntentExecGraph),用决策依赖把分散的工具调用按任务意图连接起来。 既有追踪方法主要依赖显式控制流与数据流依赖,而攻击者意图驱动的工具调用可能没有数据交换或共享参数;该工作改用推理记录中提取的上下文决策关系来建立连接。 消融实验中,把 IntentExecGraph 替换为按执行顺序连接相邻调用的时序图后,注入点准确率下降 17.00%,路径覆盖率下降 31.78%,说明该中间表示对追踪效果有实质贡献。
提出知识增强的用户意图对齐方法:结合用户请求与操作知识库构造结构化的用户意图授权空间(UA-Scope),沿动作、目标、约束三个维度判定工具调用是否发生意图漂移。 用户请求通常只给出高层目标,缺少执行细节与授权边界;该工作用操作知识库补充操作边界、前置操作、后续操作、操作目标与检查点,从而在不扩大授权范围的前提下容纳合法支撑操作。 消融实验中,用直接 LLM 判断替代 UA-Scope 与对齐谓词后,注入点准确率从 91.00% 降至 64.00%;在 100 条无注入日志的 394 条可评估执行边上,边级误报率为 3.52%。
设计事件引导的剪枝与反向追踪流程,在分析范围、图范围、路径范围三个层级逐步收窄追踪空间,从异常事件出发沿 Misaligned 边回溯,重建攻击链并定位注入源与注入点。 历史日志包含大量无关请求与调用,构造全局图会引入噪声与开销;该工作以异常事件为锚点,仅保留与异常事件相关的日志片段与意图漂移路径。 去掉事件引导剪枝、改用全历史 LLM 分析时,追踪效果接近完整方法,但平均分析时间增加 30.98%、token 消耗增加 51.24%,表明剪枝在保持效果的同时降低成本。
构建并人工标注了覆盖多场景与多步注入攻击的智能体执行日志数据集,并在混入正常任务噪声的历史日志池上完成端到端与对比评估。 评估设置同时包含单次执行内合法与恶意调用交错,以及长期累积的正常请求与后台调用噪声,背景正常工具调用与攻击链工具调用比例约为 3000:1。 端到端实验中从两个数据集各随机抽取 300 条日志,平均 IPI 检测率 97.34%、注入点准确率 94.17%、路径覆盖率 90.25%、路径精确率 93.56%;对比实验中注入点准确率高于全部基线 18.00–54.00%。
启示与展望
该方法面向执行日志中包含用户请求、推理记录与工具记录(工具调用与工具结果)的智能体,最适合遵循 ReAct 或类似“感知—规划—行动—观察”循环的架构,因为这类智能体在工具调用前记录推理,为提取上下文决策关系提供证据。它适用于攻击者能在智能体处理的外部资源中嵌入自然语言指令、但无法修改原始用户请求或执行日志的场景,且分析聚焦于恶意指令影响推理并产生可观察工具调用的注入攻击。对不产生工具执行的攻击、以及不暴露为独立工具调用的代码级注入,当前设计不直接覆盖,但论文指出可结合系统调用、文件访问与网络活动等系统级追踪技术,把执行记录关联到启动代码的工具调用,从而将攻击链延伸到代码级行为。设计上还可扩展到跨会话的持久化注入:当意图漂移路径的根节点是持久化实体时,可回溯历史日志找到创建或修改该实体的工具调用,并通过共享实体把早前会话的图与当前图连接起来。
追踪误差主要来自两方面:意图驱动执行图的构建依赖从自然语言推理记录中抽取上下文决策关系,LLM 可能抽错源实体、目标实体或预期操作,实体别名也可能导致正确抽取的关系被落到错误的实体节点上;此外,智能体即使没有遭遇注入也可能偏离用户请求,这类真实执行偏差会被正确标记为 Misaligned,却可能形成与攻击链无关的额外意图漂移分支。跨会话持久化注入的探索性复现(45 个案例、注入点准确率超过 85%)因样本量与场景覆盖不足,被作者排除在正式评估之外,持久化实体与跨会话追踪的更广泛评估仍待开展。此外,部分对比方法未公开完整实现,论文按已发表的算法、提示与规则进行复现,并以相同数据集、异常事件、标注与 LLM 主干降低实验设置差异。
