SENTINEL 通过输入-输出意图匹配将越狱成功率压至约 5% 并降低过度拒答
相关研究与后续进展核心概要
作者提出 SENTINEL:一种无需微调、在自回归生成过程中运行的越狱防御方法,它把防御重构为意图抽取问题,通过匹配输入与输出中语义一致的上下文窗口来提取揭示意图的子序列,再用拒绝方向投影对其打分并在必要时中止生成;在 HarmBench 上对多个模型将攻击成功率降至接近 5%(强对齐模型如 Llama-3-8B 接近 3%),同时在 OR-Bench 上保持较低过度拒答,并对白盒自适应攻击保持稳健,机制上表现为把越狱特征从对齐盲区重新分配到已对齐区域。
Figure 1: Intention Extraction Modeling. We solve an optimization problem over the extraction probabilities 𝐩 , 𝐪 \mathbf{p,q} to align semantically close context windows while maintaining intra-set semantic diversity. The optimization finds that context windows with features { f μ 2 , f μ 3 , f μ 4 } \{f_{\mu_{2}},f_{\mu_{3}},f_{\mu_{4}}\} are highly similar to { f ν 2 , f ν 3 , f ν 4 } \{f_{\nu_{2}},f_{\nu_{3}},f_{\nu_{4}}\} . We therefore extract an intention-related input–output context subsequence, e.g., “make a bomb from home (adv token)”, removing most adversarial tokens and making defense easier.
arXiv深度剖析
把越狱防御重新表述为意图抽取任务,利用指令微调模型输入与输出之间的语义一致性来定位有害意图。 既有防御多依赖输入扰动或有害输出抑制,很少显式建模恶意意图所在位置;该工作将意图抽取作为防御的核心步骤。 以形式化约束(对齐约束与信息量约束)给出问题定义,并在 HarmBench 上跨多个模型验证;随机打分对照的 IPS 约为 0.5,而上下文匹配的 IPS 常接近 1。
设计了一个即插即用、无需修改模型参数或训练流程的生成期防御模块,在自回归生成中周期性调用并在判定有害时中止生成。 相比需要微调的潜在空间防御(如 Circuit Breaker、LAT)或需训练小模型的 IBProtector,该方法不改变模型参数即可部署。 在 Llama2-7B、Llama3-8B、Vicuna-7b-v1.5、Mistral-7B-v0.2 上评测;报告称即使最长提示(如 AutoDAN)单次调用也在 1.5 秒以内,意图抽取本身经验上低于 0.1 秒。
给出机制解释:抽取出的意图子序列把越狱输入的特征从对齐盲区重新分配到已对齐区域,从而重新激活对齐行为。 将输入空间防御的有效性映射到潜在空间的可视化证据上,连接了输入空间方法与潜在空间对齐结构。 特征分布可视化显示越狱特征原本聚集在远离良性/有害轮廓的高密度小岛,而抽取子序列的特征回到已对齐区域;越狱子序列多落入有害区域,安全边界样本多落入良性区域。
在白盒自适应攻击下仍保持防御,攻击者优化可训练嵌入后缀以同时规避意图匹配并保留有害行为。 针对意图抽取步骤本身构造攻击,检验该防御在对抗条件下的稳健性。 两种自适应设置下 ASR 与 SR 仍处于较低水平:仅合规设置 IPS 降至 0.14–0.32 但输出常离题;合规加切题设置 IPS 升至 0.95–0.96 但意图暴露,ASR 约 3.00–6.67。
启示与展望
该结果面向使用预训练检查点(llama2-7b、llama3-8b、vicuna-7b-v1.5、mistral-7b-v2)且不额外微调的生成期防御场景,适用于需要在不改动模型参数前提下降低越狱成功率并控制过度拒答的部署方。方法主要在 token 空间运行,依赖拒绝方向投影与预计算阈值(设为良性数据投影均值加两个标准差,使约 97.5% 良性提示不受影响),因此其适用前提是目标模型存在可用的拒绝方向与良性校准数据。对希望获得可解释、低开销防御的工程团队,以及研究意图抽取与对齐机制的研究者,这一框架提供了可直接接入自回归生成的模块化路径。
读者仍需关注若干开放问题:意图抽取在 token 空间进行,作者指出这可能不如连续潜在表示表达力强,未来可尝试直接在表示空间定义意图匹配;防御效果依赖拒绝方向与阈值校准,在不同模型或分布偏移下的稳定性有待进一步观察;自适应攻击中“仅合规”设置会降低 IPS 但输出常离题,“合规加切题”设置保留行为却暴露意图,二者之间的更精细攻击面仍是开放方向;此外,正文中部分表格(如主结果表与消融表)在文本中未给出完整数值,若需精确对比各基线的 ASR 与 FPR,应查阅原文表格与附录。
