跳到主要内容
返回时间线
arXiv来源发表:

蒸馏攻击在强化学习后仍能窃取闭源模型推理能力,摘要轨迹即可达到完整轨迹的效果

核心概要

该研究提出更现实的蒸馏攻击威胁模型——攻击者在蒸馏后再进行强化学习,并通过实验表明:蒸馏后加强化学习的组合优于单独蒸馏或单独强化学习;以反蒸馏采样为例,蒸馏后看似有效的防御在强化学习后失效;仅用闭源API返回的推理摘要与最终答案,经弱模型扩展重建近似推理轨迹后蒸馏再强化学习,可取得与使用完整隐藏轨迹相近的推理提升。

AI-generated editorial illustration: Distillation Defenses Easily Break After Reinforcement Learning

深度剖析

在相同问题集上,蒸馏后接强化学习的模型表现最好,蒸馏为后续强化学习提供了“引导”作用。 以往对蒸馏攻击的评估多在蒸馏后立即进行,隐含假设攻击者不再继续训练;该工作把强化学习纳入攻击流程,并系统比较蒸馏、强化学习及两者组合。 在Qwen2.5(0.5B、1.5B、3B、7B、Math-7B)、Llama3(3.2-3B、3.1-8B)、Gemma2-2B等基座模型上,使用相同数据集与提示进行对比;例如Qwen2.5-1.5B平均准确率由基座34.5%升至蒸馏61.1%、强化学习64.6%、蒸馏后强化学习65.1%。

反蒸馏采样在蒸馏后评估中看似有效,但学生模型经过强化学习后,低到中度投毒带来的性能差距几乎消失。 此前工作通常以蒸馏后性能判断防御是否有效;该工作显示这种评估会给出虚假的安全感。 以Qwen2.5-0.5B为学生、Qwen2.5-1.5B-RL为教师,低、中、高投毒分别使教师相对性能下降10%、30%、86%;强化学习后无投毒、低投毒、中投毒学生的平均表现接近(约40.6%、40.8%、41.3%),高投毒仍较低(34.3%),但作者指出这主要源于教师本身被严重削弱。

仅使用闭源模型API返回的推理摘要和最终答案,经弱“扩展器”模型重建近似推理轨迹后蒸馏,再经强化学习,可达到与使用完整隐藏轨迹相近的推理提升。 相比需要训练扩展器或提取完整隐藏轨迹的既有攻击,该攻击更简单,且直接针对GPT、Claude、Gemini等已部署模型返回摘要的防护方式。 开源设置中以Qwen2.5-14B-RL为教师、Llama-3.2-3B-Base为学生,扩展轨迹与完整轨迹在强化学习后差距基本消失;对Claude Sonnet 4.6、GPT-5 mini、Gemini Flash 3.6的摘要进行攻击,前两者以Panfilov等(2026)方法提取的完整轨迹为基线,强化学习后简单攻击恢复相近性能;Gemini因提取攻击已被修补而无完整轨迹基线。

任何泄露足够信息以重建近似推理轨迹的蒸馏防御都可能无效,作者据此讨论响应级防御的局限与批级防御的方向。 把防御评估从单次响应层面扩展到攻击者后续训练与批量查询层面,指出响应级防御受“双用途”制约。 基于上述实验与2026年多起已报道的蒸馏攻击事件,作者提出批级防御可能覆盖更广的漏洞类别,但如何实现实时批级检测仍是非平凡的开放问题。

启示与展望

该工作面向研究蒸馏攻击与防御的研究者、模型提供方的安全团队以及制定AI安全政策的机构。其结论适用于攻击者能够通过API获取推理摘要与最终答案、并具备后续强化学习训练能力的场景;作者认为现实中的攻击者很可能采用蒸馏后接强化学习的流程,因此防御评估应在此设定下进行。作者还提出批级防御作为更可能有效的方向,并指出域特定的响应级防护(如限制网络安全类查询)在特定领域内是合理的。

所有实验使用不超过3B参数的模型,而现实蒸馏攻击可能使用参数量大得多的模型;实验集中在数学推理,其他可验证任务(如长程智能体编程)尚待检验;所提攻击未经优化,作者不认为它是最优攻击;Gemini缺少完整轨迹基线,其结论为推断;闭源模型完整轨迹的提取依赖当时未修补的端点,相关条件可能随时间变化。

来源