跳到主要内容
返回时间线
arXiv来源发表:

LLaMA-2-7B-Chat 中仅改动 down_proj 的 0.19% 权重即可把攻击成功率推高到 53% Basic ASR 与 56% GCG ASR,而 tinyBenchmarks 准确率仍为 51.6%

核心概要

该工作研究 LLaMA-2-7B-Chat 的安全敏感行为是否集中在稀疏参数子集内,采用低秩安全子空间分析与参数级安全—效用重要性筛选两种定位方法,发现安全敏感性在网络中高度不均匀,MLP 的 down_proj 始终是最突出的安全敏感组件,o_proj 贡献较小;在参数级定位下仅修改 down_proj 中 0.19% 的模型权重即得到 53% Basic ASR 与 56% GCG ASR,而 tinyBenchmarks 准确率为 51.6%,未修改基线为 52.2%。

AI-generated editorial illustration: How Fragile Is On-Device Language Model Safety? Localizing Safety-Critical Parameters for Sparse Fault Analysis

深度剖析

安全敏感参数在 LLaMA-2-7B-Chat 中高度非均匀分布,两种互补定位方法一致地把 MLP 的 down_proj 识别为最突出的安全敏感组件,注意力 o_proj 提供较小的补充贡献。 相对以往在残差流方向上刻画拒答行为、或在参数与秩两个层面识别稀疏安全区域的工作,本文把安全—效用视角用于定位一个可用于硬件故障分析的缩减候选空间,并同时给出子空间级与参数级的架构定位结果。 证据来自 LLaMA-2-7B-Chat 上的两组校准数据(AdvBench 有害指令配模型拒答、去除安全样例的 Alpaca-Cleaned),仅使用响应 token 激活;两种方法在架构定位上给出一致结论。

参数级安全—效用定位可将干预压缩到极小比例:仅针对 down_proj 时修改 0.19% 的模型权重即达到 53% Basic ASR 与 56% GCG ASR,而 tinyBenchmarks 准确率为 51.6%,接近 52.2% 的未修改基线。 相比覆盖全部模块的干预(2.95% 权重、91% Basic ASR、97% GCG ASR、效用 47.1%),该结果说明安全退化可以在远小的参数比例下实现,且测得的通用效用损失更小。 安全评估使用 AdvBench 的 100 条评估指令,攻击成功定义为生成响应缺少关键拒答模式;效用由 tinyBenchmarks 给出,作者指出它只是对效用的紧凑估计。

低秩安全子空间干预同样表现出集中性:保留干预的前 10% 仍保持显著安全退化,而降到 1% 时效果急剧下降;限制到 MLP 投影可保留大部分效果,仅 down_proj 也足以引发明显安全退化。 该稀疏化与架构限制分析把子空间级干预与具体组件对应起来,补充了参数级定位的结论,并显示更局部化设置下效用接近 52.2% 基线。 结果以 Basic ASR、GCG ASR 与 tinyBenchmarks 效用随保留比例和模块范围变化的表格形式报告,覆盖全部模块、仅 MLP 与仅 down_proj 等设置。

作者将结果定位为面向设备端与资源受限部署(含作为智能体系统组件的模型)的缩减故障面,用于后续定向故障分析与选择性完整性保护。 与直接搜索攻击有效比特的做法不同,本文先定位对安全相对效用而言不成比例重要的参数,从而为比特级分析提供更小的候选空间。 威胁模型设定为白盒对手、可离线分析但不重训或微调;实验模拟参数级干预而非物理硬件故障,作者明确说明尚未展示端到端硬件攻击。

启示与展望

该结果面向在边缘或设备端本地部署的安全对齐语言模型,包括作为资源受限智能体系统组件的模型;威胁模型为白盒对手,可访问参数并离线分析,但不重训或微调,目标是诱导稀疏参数扰动以削弱安全对齐行为同时尽量减少良性效用损失。作者强调参数稀疏不能直接等同于比特级脆弱性:0.19% 的 7B 参数仍对应数百万权重,而实际硬件故障攻击理想上只需少量物理可实现的比特修改,比特级效果还取决于数值表示、内存架构与故障机制。因此本文定位的是一个缩减的安全敏感参数空间,作为故障分析的前置步骤,而非端到端硬件攻击。作者提出的后续方向包括检验这些局部区域是否富集高影响比特级故障、与随机和基于幅度的基线比较,以及研究针对此类部署中安全敏感区域的选择性完整性保护。

效用结论依赖 tinyBenchmarks 这一紧凑估计,作者也指出它只提供对通用能力的有限度量,因此安全退化与效用保持之间的权衡仍需更广的评测来确认。安全评估基于 AdvBench 的 100 条评估指令与缺少关键拒答模式的判定,不同判定口径下的攻击成功率可能不同。参数稀疏与比特级脆弱性之间的关系尚未建立,数值格式、内存架构与故障机制的影响有待未来工作。此外,本文仅在一个模型上验证,其他架构、规模与量化设置下 down_proj 是否同样突出仍是开放问题。

来源