OPUR 用危害度重加权分布统一越狱目标,在随机解码下把 Llama-3.1-8B 的 AgentHarm 攻击成功率提到 75.00%
核心概要
该工作从概率角度重新表述 LLM 智能体越狱:证明期望危害度对数对输入的梯度,等于在危害度重加权输出分布下模型对数似然的期望梯度,从而把期望危害度最大化与目标似然优化统一起来;据此提出 OPUR,用模型自身随机 rollout 构造代理目标来引导对抗后缀优化,在 AgentHarm、InjecAgent、WebShop 三个基准上取得更高的定向攻击成功率。
Figure 1: Overview of our probabilistic view of jailbreak optimization. Given an adversarial input, the model induces a response distribution pdis(y) = pθ(y | x, s), while the harmfulness function induces a preference pvic(y) ∝ψ(y). Considering either view alone may favor responses that are likely but insufficiently harmful, or harmful but unlikely. Their normalized product defines the reweighted distribution π, which emphasizes responses that are simultaneously likely under the model and harmful under the attack objective. Since exact sampling from π may be unavailable in practice, its high-probability regions can be represented by constructed surrogate targets and opti- mized through their likelihood. As optimization proceeds, model probability mass is progressively shifted toward harmful outputs, providing a unified interpretation of expected harmfulness maxi- mization and target-likelihood optimization.
arXiv · 第 2 页深度剖析
论文给出期望危害度目标与目标似然目标之间的梯度级等价关系:期望危害度对数的梯度,等于在危害度重加权响应分布下模型对数似然的期望梯度。 此前基于期望危害度的攻击(如 REINFORCE-GCG)与基于目标似然的攻击(如 GCG、UDora)被当作两类独立目标;该恒等式说明二者在固定输入处产生相同的更新方向,把行为级风险与似然优化放进同一个响应分布框架。 结论以定理形式给出,并附证明(附录 A),前提是求导与期望可交换;论文同时指出该重加权分布与已有概率对抗攻击具有相同的乘积形式。
提出 OPUR:用模型自身随机 rollout 近似危害度重加权分布,通过温度控制的概率位置采样与探针筛选构造代理上下文,再聚合多 rollout 的交叉熵梯度更新对抗后缀。 针对随机解码下确定性最高分位置选择可能过拟合单条轨迹的问题,OPUR 概率性地探索多组互不重叠的位置集合,并保留探针损失最低的上下文,使优化同时兼顾候选多样性与可靠性。 算法分四步完整描述(随机 rollout 生成、概率位置采样、上下文筛选、后缀更新),并给出位置打分与代理损失公式;每个 rollout 采样 4 组注入位置、保留 2 个候选,代码与配置公开。
在三个智能体基准上,OPUR 在随机解码下取得更高定向攻击成功率:AgentHarm 上 Llama-3.1-8B-Instruct 平均 ASR 75.00%,高于最强 UDora 基线;InjecAgent 上达 49%(Llama)与 40%(Ministral);WebShop 上达 26.67%(Llama)与 36.67%(Ministral)。 相对 GCG、REINFORCE-GCG 与 UDora 的 Sequential/Joint 变体,OPUR 在多数类别上领先;在 Ministral 的 AgentHarm 上性能已接近饱和,OPUR 与最强 UDora 变体持平(99.43%)。 结果以 ASR 为指标,覆盖恶意指令与恶意环境两类场景、两个开源指令微调模型;消融显示增大优化 rollout 预算通常提升 ASR,但增益并非严格单调。
启示与展望
该结果面向以开源指令微调模型为受害者的智能体红队评测:实验在 AgentHarm(恶意指令)、InjecAgent 与 WebShop(恶意环境)上进行,全部使用 ReAct 提示与公开基准,不涉及真实用户、账号或已部署服务。对希望复现或扩展该框架的研究者,论文公开了代码与实验配置,并给出攻击公式、数据集、基线、模型设置、优化参数与解码配置,便于在同类基准上做独立验证与防御对比。方法适用于可获取梯度与 token 概率的模型,其代理上下文仅用于优化、不修改智能体实际生成的响应。
正文中多处 ASR 数值以占位形式出现,需对照表格确认;部分表格(如 AgentHarm 与 InjecAgent 的消融)在正文中未给出完整数值,只能从描述性语句推断趋势。定理成立依赖求导与期望可交换、危害度函数不显式依赖后缀等假设,实际优化中这些条件的满足程度值得关注。此外,rollout 预算增大带来的增益并非严格单调,不同基准与模型上的最优预算仍需进一步刻画;在性能已接近饱和的模型上,方法相对基线的区分度有限。
