PersistBD 将后门在良性 SFT 后的攻击成功率从 20% 提升到 74%,并在 RL 后保持 76%
核心概要
该研究考察攻击者提供的带后门模型在开发者良性监督微调(SFT)与任务级强化学习(RL)后是否仍保留后门,发现 SFT 大幅削弱攻击成功率而 RL 往往保留甚至提高残余攻击成功率,并据此提出 PersistBD:在发布前用单个 LoRA 适配器强化后门强度与梯度兼容性,在 Qwen2.5-Coder-7B 上把 SFT 后攻击成功率从 20% 提升到 74%、SFT–RL 后从 20% 提升到 76%,同时良性任务解决率与基线相当。
深度剖析
在软件工程智能体的 SFT–RL 流水线中,良性 SFT 会显著削弱后门但不会消除它,随后的 RL 通常保留残余攻击成功率,并在部分设置下提高它。 此前关于继承式供应链后门的研究多关注单一训练阶段;这里把插入、良性 SFT 与任务奖励 GRPO 串成一条流水线,分别报告各阶段攻击成功率。 在 3B、7B、30B 三个模型上,插入后攻击成功率为 100%,SFT 后分别降至 8%、20%、7%;RL 后随机位置设置下为 7%、20%、8%,首位触发设置下 30B 从 6% 升至 12%,7B PersistBD 从 34% 升至 42%。每个评估设置含 100 条触发前缀与 100 条干净对照,干净对照的误触发率在所有评估的 RL 步上保持 0%。
一阶分析把 SFT 阶段的后门存留归因于两个因素:初始后门强度,以及后门损失梯度与良性训练梯度的兼容性。 该分解把“后门是否存活”从整体现象拆成可分别测量的初始强度与局部梯度对齐,并用诊断适配器扫描检验二者与 SFT 后攻击成功率的关系。 在近似固定另一因素的条件下扫描系数:最弱变体 SFT 后仅保留 23% 攻击成功率,最强变体最高保留 95%;兼容性扫描中攻击成功率总体随兼容性上升,但曲线并非严格单调。作者说明该控制只是近似隔离,且分析基于局部一阶近似。
PersistBD 在发布前用单个联合 LoRA 适配器同时提高后门强度与梯度兼容性,从而提升后门穿过开发者 SFT 与 RL 的存留率。 与优化触发词的方法不同,PersistBD 保持触发词固定,改为精调已带后门的模型权重,且攻击者不需要开发者 SFT 数据,只用独立的良性轨迹估计良性训练方向。 三个规模上强度均上升(3B 9.5→11.5,7B 10.9→14.3,30B 10.0→16.1),兼容性由负转正;7B 上 SFT 后攻击成功率 20%→74%、RL 后 20%→76%,3B 为 8%→21% 与 7%→22%,30B 为 7%→37% 与 8%→36%。
在评估的训练终点上,PersistBD 的良性任务解决率与 Base 后门相当或更高。 该比较把 PersistBD 的额外影响与后门插入本身的效用代价分开:30B 在插入后解决任务数从 101/300 降到 20/300,说明插入本身有独立代价。 7B 上 PersistBD 在 SFT 后解决 23/300,Base 为 20/300,RL 后两者均为 27/300;三个模型在两个训练终点上 PersistBD 的解决率均不低于 Base。消融显示去掉强度项后攻击成功率降至 5%,去掉兼容性或良性锚项后误触发率升至 0.99 与 0.87 且攻击成功率归零。
启示与展望
该结果面向从第三方权重出发、以 SFT 加任务奖励 RL 适配软件工程智能体的开发者:它说明在这一设置下,发布前精调可以显著提高后门穿过两阶段训练的存留率,因此防御方需要在采纳外部模型时以及后训练过程中进行检测。方法本身可复现,代码已公开,攻击者只需独立的良性轨迹即可估计良性训练方向,不需要开发者的 SFT 数据。
一阶近似只刻画单步更新,无法预测完整训练轨迹或 RL 阶段的行为;强度与兼容性的扫描只是近似隔离,二者的独立因果贡献与交互仍未完全厘清。观察到的 RL 阶段攻击成功率上升在分支间并不一致,其机制与可复现性仍待解决。结果依赖所评估的 SFT 与 RL 过程及训练预算,更长训练、不同数据或更广的后训练流程能否彻底消除后门仍是开放问题。此外,P-Trojan 对比与组合实验尚未在任务实例不相交的划分上重复。
