安全对齐但植入后门的教师模型经在策略蒸馏把后门传给干净学生:3%投毒率下触发攻击成功率最高约70%
核心概要
该工作研究在策略蒸馏(OPD)用于安全对齐时是否会传播后门:作者用bi-GRPO构造安全对齐但含后门的教师模型,通过OPD训练原本干净的学生,发现仅3%投毒率即可使触发攻击成功率最高约70%,且增加训练轮数(10个投毒样本、16轮后达67%)与使用top-K KL都会加速后门迁移,并提出通过裁剪KL奖励的Lazy Defense来延缓这一过程。
Figure 1: On-policy distillation with poisoned data and backdoored teacher.
arXiv深度剖析
在策略蒸馏可以把教师模型隐藏的后门迁移到原本干净的学生模型,即使投毒率很低。 以往OPD与OPD-for-safety工作通常假设教师与训练数据可信,本文首次系统考察教师携带后门时OPD的安全风险。 在Qwen2.5-1.5B/3B/7B上构造同规模与跨规模教师-学生对,训练集1000条干净样本、投毒率1%–10%,在DAN、DNA、Addition、StrongREJECT、AdvBench五个安全数据集上用Llama Guard 3评估;同规模设置下3%投毒时触发ASR约67%(3B)与50%(7B),干净ASR低于5%。
增加训练轮数会在极少投毒样本下显著提升后门迁移,而干净输入上的安全性基本不变。 此前固定训练预算下低投毒率触发ASR较低,本文表明这更多反映训练不足而非无法学到后门。 同规模设置下仅10个投毒样本(1%投毒),触发ASR从第8轮接近零升至第16轮约67%(3B)与27%(7B);跨规模设置下3%投毒从第8轮接近零升至第16轮约81%,5%投毒从第4轮接近零升至第16轮约87%;全程干净ASR保持低位。
top-K KL比采样token KL更快地加速后门迁移。 以往认为K的取值对整体训练性能影响不大,本文表明KL估计器的选择会显著改变后门学习动态。 在Qwen2.5-3B蒸馏1.5B、5%投毒下,top-K KL的触发ASR比采样token KL提前数个轮次上升;作者用token级梯度分解(直接项与softmax归一化的间接项)以及学生-教师token重叠的Jaccard相似度随训练上升来解释这一延迟。
Lazy Defense通过裁剪KL奖励、放缓学生更新,在低投毒率设置下延缓后门迁移,同时大体保留无触发输入上的安全性。 该方法不需要知道触发器或哪些样本被投毒,对所有样本统一施加奖励裁剪,是一种不依赖投毒识别的缓解手段。 在四个Qwen2.5教师-学生对、1%–10%投毒率下与top-K KL、采样token KL对比;在3B学生3%与5%投毒、以及另一对3%投毒设置中,Lazy Defense使触发ASR在更多轮次内保持低位。
启示与展望
该结果适用于使用外部教师与可能被投毒训练数据的OPD安全对齐流程,尤其是同规模与跨规模Qwen2.5教师-学生对、1%–10%投毒率、固定或延长至16轮训练的设定。对实践者而言,它提示在采用OPD做安全对齐时,应把教师来源与数据来源的可信度、训练轮数与KL估计器选择一并纳入风险评估,并可尝试Lazy Defense这类不依赖触发器知识的奖励裁剪手段。对研究者而言,它提供了把后门迁移与token级梯度、学生-教师token重叠联系起来的分析框架,可用于设计更可靠的防御。
读者仍需关注:结论基于bi-GRPO构造的教师与Qwen2.5系列,其他后门植入方式或模型族下的迁移幅度尚不明确;Lazy Defense只是延缓而非阻止后门迁移,作者也指出在保留安全收益的同时可靠防止后门继承仍是开放问题;此外,本文的威胁模型假设用户不知道触发器与投毒样本,实际部署中教师与数据的可信边界如何界定仍需进一步研究。
