向提示词嵌入加入高斯噪声的PEV攻击在六个开放权重LLM上实现JailbreakBench 100%越狱率
核心概要
该工作提出扰动嵌入向量(PEV)越狱攻击:仅在提示词的嵌入表示上叠加独立高斯噪声并反复重采样,无需梯度计算或修改模型权重,在六个开放权重LLM上对JailbreakBench全部100条有害提示均取得100%越狱成功率,且首次成功越狱的平均耗时通常在一分钟以内,比所比较的既有方法更快更省算力。
Figure 1: Our Perturbed Embedding Vectors ( PEV ) attack. Gaussian noise z ~ i ∼ σ ⋅ 𝒩 ( 0 , I ) \tilde{z}_{i}\sim\sigma\cdot\mathcal{N}(0,I) is added to each token embedding E ( t i ) E(t_{i}) before being fed to the transformer block. At σ = 0.003 \sigma=0.003 the same “safe” model (GLM-4-9B) that refused the unperturbed harmful prompt now produces a response in another language, an unsafe completion, or degenerate output across runs.
arXiv深度剖析
PEV在JailbreakBench的100条有害提示上对全部六个开放权重模型取得100%越狱率,而所比较的基线方法均未达到满分,例如RefusalCones在各模型上的报告值介于89至98之间,-GCG、SoftPrompt、LatentFusion、NeuroStrike的均值分别为75.2、81.0、61.0、91.3。 既有越狱方法通常需要梯度计算、逐提示优化或改动模型内部权重;PEV只做一次嵌入层加噪的前向传播,把攻击简化为对同一提示反复重采样噪声。 六个不同规模模型(Qwen2.5-1.5B、SmolLM3-3B、Phi-4-mini、Mistral-7B、Llama-3.1-8B、GLM-4-9B)各100条提示、每条20次运行,输出由Claude Opus 4.6按JailbreakBench判定指令分类,作者并人工复核了全部被标为unsafe的响应。
PEV取得首次成功越狱的平均时间在所有测试模型上均在一分钟以内,且无需预处理;按作者报告,取得首次成功攻击的平均算力成本比先前攻击低至多一个数量级。 RefusalCones与NeuroStrike在完成校准后单提示运行时间与PEV相当,但其主要耗时来自预处理,整体上比PEV慢一个数量级;-GCG因耗时过长未被纳入时间对比图。 全部实验在单张NVIDIA A100-SXM4-80GB上通过Google Colab完成,按每提示20次运行的批次记录墙钟时间,并在100条提示全部完成后报告总时间。
每个模型存在一个使越狱率最高的噪声强度峰值:随扰动增大,不安全响应率先升后降;作者据此为各模型固定取值,并报告该噪声范数与提示嵌入平均范数之比跨越6%至240%的宽范围。 这一现象提示即使相对于原嵌入幅度很大的扰动,提示语义仍足以被保留,使模型按有害提示的要求作答,作者将其列为值得未来研究的问题。 峰值通过在少量不安全提示上扫描不同取值、统计不安全响应比例确定;各模型的最优取值与逐提示运行统计(含最大运行次数与平均运行次数)一并报告。
PEV所需重采样次数通常很少:多数模型在20次以内即可越狱,GLM-4-9B与Phi-4-mini的累计曲线迅速收敛到100%,而Qwen2.5-1.5B需要更长时间,存在少数顽固提示,其最大运行次数达160。 由于PEV是随机化攻击,同一提示的多次独立加噪可累积成功率,这与所比较的确定性方法形成对照——作者观察到其他方法增加运行次数并不提高越狱率。 逐提示记录达到首次不安全响应所需的迭代次数分布,并区分safe、unsafe、degenerate三类输出;随扰动增大,退化响应增多,但安全响应比例仍保持非平凡水平。
启示与展望
该结果面向可访问嵌入层的开放权重指令微调模型,作者明确说明技术目前限于开放权重模型,并设想扰动可作为为闭源模型生成不安全训练数据的廉价手段,以帮助设计更强的安全护栏与训练数据。方法只需一次性写入嵌入层即可执行原始模型的前向传播,不修改模型权重或隐藏层,也不改变用户可见的提示,因此可跨提示复用。作者还提出把扰动作为研究LLM动力学行为的工具,认为有用提示可能位于全部可能输入中一个很小甚至测度为零的区域,扰动可探索该区域之外的行为,并与动力系统理论建立联系。
读者仍需关注若干开放问题:噪声强度峰值需按模型单独扫描确定,其与嵌入维度和提示长度的关系尚未给出解析刻画;作者报告噪声范数与提示嵌入范数之比跨越6%至240%,为何如此大的相对扰动仍能保留提示语义,作者将其列为值得未来研究的问题;随扰动增大退化响应增多而安全响应比例仍非平凡,这一现象同样有待更深入分析;此外,越狱判定依赖Claude Opus 4.6按JailbreakBench指令分类并由作者人工复核,不同判定器下的成功率是否一致仍属开放问题。
