LADE 用首 token 概率分布中的暗知识提取跨模型安全信号,在多个越狱攻击下降低攻击成功率并保持安全—可用性平衡
核心概要
该工作提出 LADE,一种仅依赖首 token 输出概率分布的模型无关防御框架:通过对比有害与良性查询,从暗知识中选出概率差异最大的 token 作为潜在安全信号,经分词器映射对齐到目标模型,再用 kNN 距离在生成前过滤有害查询;在 Llama-2-7B-Chat、Llama-3-8B-Instruct、Qwen2-7B-Instruct、Qwen3-8B、Gemma-7B-it、Mistral-7B-Instruct-v0.3 等模型上,LADE 在多种越狱攻击下取得最低或接近最低的平均合规率,并在八个模型中的六个上取得最佳安全—可用性平均表现。
Figure 1 : The key idea of LADE . (Left) Latent safety signals ( red points), identified by contrasting first-token probabilities between harmful and benign queries, are extracted from a reference LLM and transfer across target LLMs, while model-specific surface tokens ( gray points) remain scattered. (Right) Refusal tokens capture only a small subset of safety signals and fail to separate harmful from benign queries (top), whereas adding extracted latent safety signals yields clear separation (bottom).
arXiv深度剖析
作者发现安全对齐 LLM 的首 token 输出概率分布中存在潜在安全信号,即概率在有害与良性查询之间差异最大的 token,这些信号在不同安全对齐模型间一致对齐,形成模型无关的判别方向。 此前解码阶段防御依赖内部隐藏状态或表面拒绝 token(如“Sorry”“As”),本文把判别信息定位到首 token 概率分布的暗知识中,并给出跨模型迁移的经验证据。 在 Gemma 家族中,同一预训练骨干的 Gemma-7B 平均分类准确率为 0.6836,指令微调后的 Gemma-7B-it 升至 0.9396,Gemma-2-9B-it 为 0.9474,Gemma-3-4B-it 为 0.9647;跨模型参考—目标组合的迁移准确率与同模型自用相当。
LADE 由三部分组成:从暗知识提取潜在安全信号、跨分词器映射、基于 kNN 的判别,全部在输出概率上运行,不访问内部隐藏状态,并在生成开始前一次性过滤查询。 与 SafeDecoding、RDS、SafeInfer 等在每个解码步调整 token 概率或隐藏状态的方法不同,LADE 只做一次生成前过滤决策,因而无需架构特定的辅助模块。 分词器映射消融显示,同时启用子词切分处理与重复映射比例估计后,跨模型迁移平均准确率最高且最均匀;仅启用比例估计时平均准确率提升但仍有明显退化,说明子词切分处理是跨分词器迁移的主导因素。
在六至八个开源 LLM 与多种越狱攻击上,LADE 取得最低或接近最低的平均合规率,并在安全—可用性权衡上优于现有防御基线。 Self-Reminder 与 SafeDecoding 在弱对齐模型(如 Gemma-7B-it、Mistral-7B-Instruct-v0.3)上效果崩塌或引发大量过度拒绝,而 LADE 在这些模型上仍保持较低合规率与较低拒绝数。 表 1 中 LADE 在 Qwen2-7B-Instruct、Gemma-7B-it、Mistral-7B-Instruct-v0.3 上取得最低平均合规率;表 2 中 LADE 在八个模型中的六个上取得最佳平均表现,例如 Llama-2-7B-Chat 上为 1.60,优于 RDS 的 5.00。
与专用 guard 模型相比,LADE 在 Llama-3-8B-Instruct 上取得最高平均准确率 0.969,并在延迟与显存上更具优势。 guard 模型是独立训练的安全分类器,而 LADE 复用目标 LLM 的首 token 前向传播,无需额外模型或安全专项训练。 表 3 中 LADE 平均准确率 0.969,高于 WildGuard-7B 的 0.947、Llama-Guard-4-12B 的 0.852 与 Prompt-Guard-2-86M 的 0.575;表 4 中 LADE 显存占用最低(14.96 GiB),且比 Llama-Guard-4-12B 与 WildGuard-7B 快约数倍。
启示与展望
LADE 适用于已进行安全对齐、且可获取首 token 输出概率的 LLM 部署场景,例如公开权重模型或允许读取前若干候选 token 概率的接口;其离线阶段用 Hex-Phi 作为有害提取集与有害参考集、XSTest 作为良性提取集,并以 Llama-3-8B-Instruct 为参考模型,在线阶段对每个查询做一次生成前过滤。对安全对齐较弱的模型,判别准确率会下降,因此 LADE 被定位为与安全对齐并行的补充而非替代。对闭源 API,附录 I 显示仅保留最可能的少量首 token 即可复现几乎全部过滤决策,说明该路线在受限概率访问下仍可运行。
LADE 依赖目标模型存在安全对齐,对弱对齐模型判别准确率较低;在 Mistral-7B-Instruct-v0.3 上对 Alpaca 良性查询的拒绝数高于无防御基线,说明有害参考流形与部分对话式良性查询存在重叠;面对知晓 LADE 全部组件的白盒自适应攻击,准确率从 1.000 降至 0.480,虽仍高于所比较的 guard 模型,但作者明确说明该评估只覆盖单一受控白盒攻击,不能确立对所有自适应攻击的稳健性。此外,对间接或情境依赖的有害查询(如涉及虚假医疗主张或对未来事件的特定预测),首 token 分布未呈现清晰判别模式,这类边界情形仍是开放问题。
