跳到主要内容
返回时间线
arXiv来源发表:

微调服务被投毒后,只修两层就能把有害分从11.54压到0.08,任务精度不掉

导语

恶意微调会削弱大模型拒答能力,SLDR 只在敏感度谱两端的两层上训练 LoRA 恢复适配器并按查询动态启用,在 Llama3.1/SST2 上把平均有害分从 11.54 降到 0.08,同时保持下游精度。

Source-provided article image: SLDR: Defending Against Malicious Fine-tuning via Selective Layers Recovery and Dynamic Routing
Figure 1 · arXiv

正文

微调即服务让用户用自己的数据改造已对齐的大模型,攻击者可以借同一接口把少量有害指令-回答对混进正常任务数据,使模型在正常输入上照常干活、在有害请求上却不再拒答。 此前的修复要么在微调前约束更新,要么在微调后做模型级粗粒度恢复,例如扰动权重或剪掉有害参数,安全修复与任务行为纠缠在一起,很难只恢复拒答而不伤任务表现。 在默认的 Llama3.1/SST2 设置下,不做防御的 SFT 平均有害分为 11.54,SLDR 把它降到 0.08,同时下游精度与 SFT 持平。

做法是先给每一层做一次带符号的敏感度诊断,再只修谱两端的那两层。 此前的层级诊断只说明安全行为集中在哪些层,不区分某层是强化拒答还是削弱拒答;SLDR 用缩放探针把每层注意力与前馈权重放大或抑制,测拒答计数的归一化带符号变化,正分表示加强该层会提高拒答,负分表示会压低拒答。 在 Llama3.1-8B-Instruct 的 32 层上,相邻的第 12 层与第 13 层敏感度都很大但符号相反,说明只盯正分安全层会漏掉互补的失效模式。

接下来

下一步可以在更大参数量的模型上验证这套诊断是否仍能稳定选出谱两端的两层,因为当前实验只做到 7B 到 8B 量级。做微调服务的工程团队可以把它当作微调后的修复环节:先用一次离线探针选层,再在少量对齐数据上训练恢复适配器,推理时按查询决定是否启用。对研究路由机制的人,值得在分布外输入上继续检验恶意分阈值的行为。

带符号敏感度谱是否在更大模型和更复杂攻击下保持同样的两端结构,仍需更多设置来确认。路由依赖表示相似度,若攻击者构造出让恶意分低于阈值的输入,条件启用可能被绕过,这一点在原文中作为未讨论的稳健性问题提出。面向低资源语言编码类越狱时,各方法的有害分都明显升高,SLDR 虽最低但仍有残余,路由对这类分布偏移的加固是后续可关注的方向。

来源