Needle 用权重正交化一次性移除大模型后门:代码注入攻击成功率降到 0,同时把能力与安全损失压到最低
核心概要
该工作提出免训练的后门移除方法 Needle:在已知触发词的前提下,用激活向量估计一个后门方向和一个拒绝子空间,再对模型权重做逐层顺序正交化,在 Gemma-3-4B-IT、Qwen3-4B-Instruct-2507 及 Gemma-3-12B-IT 上把平均攻击成功率降到所评估防御中最低,并在代码注入攻击上实现完全移除,同时取得最低的 KL 散度与最小的能力、安全变化。
深度剖析
作者发现后门行为在激活空间中大体可由单一方向刻画,且该方向与介导拒绝行为的方向高度相关,重叠部分大多落在单一主拒绝方向之外。 此前对后门移除的研究多针对分类模型,或依赖干净参考模型与推理期干预;这里把后门刻画为可定位的激活方向,并量化它与拒绝表征的重叠。 基于 Gemma 与 Qwen 两个模型族、三种攻击行为与两类触发器的实验,并用逐层余弦相似度显示:情感引导与代码注入在编辑层上与主拒绝方向的相似度较低,到四维子空间才明显上升;定向拒绝攻击在秩一时就已很高。
Needle 通过闭式权重编辑同时满足两个约束:移除后门投影、保留拒绝子空间投影,并用逐层顺序校正补偿早期层编辑带来的漂移。 与在推理期替换 token 或引导激活的防御不同,Needle 直接永久修改权重,不需要干净参考模型,也不需要原始被投毒的训练数据。 方法在注意力输出与 MLP 下投影矩阵上施加正交化,校正项用岭回归拟合,并在附录中与最小范数最小二乘、LASSO 对比,差异很小(ASR 最多 1 个百分点量级)。
在评估中 Needle 取得所比较防御中最低的平均攻击成功率,并同时保持最低的分布偏移与最小的能力、安全代价。 既有微调类防御往往在移除不可靠与能力、安全损失之间取舍;Needle 报告的是移除效果与副作用同时占优的组合。 Gemma 上平均 ASR 从基线降到更低水平、Qwen 上同样下降;代码注入攻击 ASR 为 0,而最好基线仍有明显残留;平均相对能力损失与 KL 散度均低于微调类基线;定向拒绝是最难的情形,Needle 在该攻击上 ASR 最高。
消融显示保留拒绝子空间与顺序校正都降低安全代价,且只编辑中后层比编辑早期层更合适。 把“直接消融后门方向”这一自然基线拆解为可分离的设计选择,并给出各选择在 ASR、能力与有害回复率上的取舍。 在 BadNet 情感引导攻击上,直接消融后门方向会大幅提高有害回复;保留单一拒绝方向、再扩展到拒绝子空间、再叠加顺序校正,安全指标逐步改善;编辑早期层可完全移除后门但能力损失与 KL 明显变大。
启示与展望
该结果面向已识别出触发词与插入规则的防御场景,适用于拥有白盒权重、但拿不到原始投毒数据或干净参考模型的开放权重模型;作者明确把 Needle 定位为与触发词检测、重建工作互补的定向移除环节,并开源了实现。对使用者而言,这意味着在检测步骤可靠的前提下,可以用一次权重编辑替代推理期干预或大范围微调,从而在计算受限环境中保持原有能力与拒绝行为。
作者在局限中说明,实验覆盖的是一组合成的、触发与行为显式关联的数据投毒攻击,未涵盖自然出现的伪相关行为或刻意规避表征移除的攻击;移除是否能在后续微调或再次投毒后保持,也仍是待检验的问题。此外,定向拒绝攻击上 Needle 的 ASR 最高,作者解释为后门目标本身就是拒绝,与需要保留的拒绝行为存在取舍。本证据包为全文,但部分表格与附录数值在文本中以占位形式呈现,具体逐项数字需回到原文核对。
