LTBD 用四个可学习信任边界分隔符在四个开源模型上把 AlpacaFarm 注入成功率降到 0.00%
核心概要
作者提出 LTBD:在冻结大模型参数的前提下,只训练四个可学习分隔符嵌入,把它们分别放在可信指令与不可信外部数据的边界上,从而显式编码信任来源;在 Llama3-8B、Llama3.1-8B、Falcon3-7B、Qwen2.5-7B 四个指令微调模型上,AlpacaFarm 攻击成功率均为 0.00%,TaskTracker 为 0.11–0.19%,并在攻击者完全知晓防御的 Delimiter-Spoof 自适应攻击下保持接近不变。
Figure 1: Overview of Learnable Trust-Boundary Delimiters (LTBD) . (a) Prompt injections embedded in external data steer the LLM away from the original task. (b) LTBD insert four learnable delimiters to explicitly mark the trusted instruction region and the untrusted data region. The delimiter delimiter embeddings are the only trainable parameters, while the base LLM f θ f_{\theta} remains frozen. During inference the input is wrapped with the learned delimiters, enabling the model to follow the trusted instruction and treat the (potentially attacked) external data as data rather than a new instruction.
arXiv深度剖析
论文把提示注入重新表述为信任边界建模问题:可信用户指令与不可信外部数据在同一输入序列中却具有不同行为权威,而现有模型缺少对信任来源的显式表示。 相对 Reminder、Sandwich 等手工提示防御,以及 StruQ 这类需要微调模型参数的训练式防御,该工作把“边界本身”作为可学习对象,而不是靠提示措辞或改动模型权重。 该视角由方法设计与消融共同支撑:在 Llama3.1-8B 上,把同样四个可学习 token 从输入前缀改为放在信任边界处,AlpacaFarm ASR 从 23.08% 降到 0.48%,SEP ASR 从 33.81% 降到 3.43%,说明增益来自边界位置而非仅仅增加可训练 token。
LTBD 只优化四个分隔符嵌入,基础大模型参数完全冻结,无需辅助防御模型,也不改动模型权重。 与 DefensiveToken 学习全局防御 token 不同,LTBD 的每个分隔符绑定到具体的结构边界,因而学到的是信任感知角色,而非通用控制前缀。 训练在 Cleaned Alpaca 指令微调数据集(51K 样本)上进行,单轮训练,一半样本保持不变、另一半随机注入 Ignore、Completion 与 Delimiter-Spoof 三种变体之一,四个模型使用同一数据构造协议。
在安全—效用权衡上,LTBD 在 AlpacaFarm 上对四个模型均达到 0.00% ASR,TaskTracker 为 0.11–0.19%,同时 AlpacaFarm WinRate 在四个模型上均为防御方法中最高。 相对 DefensiveToken,SEP ASR 从 3.20/2.81/6.70/4.40% 降到 2.04/2.00/1.57/1.86%;相对 StruQ-Full、StruQ-LoRA、SecAlign-LoRA 等更新模型参数的方法,LTBD 在 TaskTracker 以及 Falcon3、Qwen2.5 的 SEP 上持平或更优。 效用用 AlpacaEval2 协议、GPT-4o 作为评判、与 GPT-4 Turbo 参考对比,报告 WinRate;安全报告 ASR,AlpacaFarm 取 Ignore、Completion、Ignore-Completion 的最差情况。LTBD 在 8 项效用评估中有 6 项达到或超过无防御模型,相对 DefensiveToken 在 8 项中有 7 项效用更高。
在攻击者完全知晓四个分隔符与输入结构的 Delimiter-Spoof 自适应攻击下,LTBD 的最差情况 ASR 几乎不变。 该攻击伪造分隔符模式以模仿、终止或重开可信与不可信区域,共五个变体;结果显示伪造分隔符语法相比普通注入几乎没有额外优势。 Llama3-8B 与 Falcon3-7B 最差情况 ASR 保持 0.00%,Llama3.1-8B 为 0.48%,Qwen2.5-7B 仅从 0.00% 升到 0.48%。作者据此指出鲁棒性来自与真实结构边界绑定的学习嵌入,而非分隔符的表面文本形式。
启示与展望
该结果面向需要把不可信外部数据放入上下文的 LLM 应用,例如检索增强、工具调用与代理式工作流,适用前提是输入可以被明确划分为可信指令区域与不可信数据区域,并且部署方能够为每个模型单独训练四个分隔符嵌入。对无法区分这两类区域的场景,或外部数据本身需要被赋予指令权限的场景,方法的前提不成立。论文报告的是四个开源指令微调模型上的结果,训练使用 Cleaned Alpaca 数据集与单轮训练,评估使用 AlpacaFarm、SEP、TaskTracker、CyberSecEval2 四个基准,因此其结论的适用范围以这些模型与基准为界。
值得继续观察的是:Delimiter-Spoof 的五个变体由作者构造并同时用于训练增强,因此自适应攻击的强度边界仍取决于该攻击族的覆盖范围;论文未报告训练四个分隔符嵌入所需的具体计算量,也未给出推理延迟的量化数值,只表述为可忽略;CyberSecEval2 上 LTBD 与训练式防御互有高低,例如 Llama3-8B 上 LTBD 为 7.27% 而 StruQ-Full 为 10.9%、SecAlign-LoRA 为 18.2%,但 Falcon3-7B 上 LTBD 为 1.82% 而 StruQ-Full 为 7.3%,说明不同基准与模型组合下的相对优势并不一致。此外,分隔符嵌入与具体模型绑定,更换基座模型后是否需要重新训练、跨模型能否复用,文本未作说明。
