arXiv 2026年10月6日作者提出 SENTINEL:一种无需微调、在自回归生成过程中运行的越狱防御方法,它把防御重构为意图抽取问题,通过匹配输入与输出中语义一致的上下文窗口来提取揭示意图的子序列,再用拒绝方向投影对其打分并在必要时中止生成;在 HarmBench 上对多个模型将攻击成功率降至接近 5%(强对齐模型如 Llama-3-8B 接近 3%),同时在 OR-Bench 上保持较低过度拒答,并对白盒自适应攻击保持稳健,机制上表现为把越狱特征从对齐盲区重新分配到已对齐区域。作者提出 SENTINEL:一种无需微调、在自回归生成过程中运行的越狱防御方法,它把防御重构为意图抽取问题,通过匹配输入与输出中语义一致的上下文窗口来提取揭示意图的子序列,再用拒绝方向投影对其打分并在必要时中止生成;在 HarmBench 上对多个模型将攻击成功率降至接近 5%(强对齐模型如 Llama-3-8B 接近 3%),同时在 OR-Bench 上保持较低过度拒答,并对白盒自适应攻击保持稳健,机制上表现为把越狱特征从对齐盲区重新分配到已对齐区域。SENTINEL 通过输入-输出意图匹配将越狱成功率压至约 5% 并降低过度拒答作者提出 SENTINEL:一种无需微调、在自回归生成过程中运行的越狱防御方法,它把防御重构为意图抽取问题,通过匹配输入与输出中语义一致的上下文窗口来提取揭示意图的子序列,再用拒绝方向投影对其打分并在必要时中止生成;在 HarmBench 上对多个模型将攻击成功率降至接近 5%(强对齐模型如 Llama-3-8B 接近 3%),同时在 OR-Bench 上保持较低过度拒答,并对白盒自适应攻击保持稳健,机制上表现为把越狱特征从对齐盲区重新分配到已对齐区域。作者提出 SENTINEL:一种无需微调、在自回归生成过程中运行的越狱防御方法,它把防御重构为意图抽取问题,通过匹配输入与输出中语义一致的上下文窗口来提取揭示意图的子序列,再用拒绝方向投影对其打分并在必要时中止生成;在 HarmBench 上对多个模型将攻击成功率降至接近 5%(强对齐模型如 Llama-3-8B 接近 3%),同时在 OR-Bench 上保持较低过度拒答,并对白盒自适应攻击保持稳健,机制上表现为把越狱特征从对齐盲区重新分配到已对齐区域。