RASteer 用保留感知激活引导实现扩散模型概念擦除,在多个骨干与基准上匹配或超越激活引导与权重编辑基线
相关研究与后续进展核心概要
该工作提出免训练的保留感知激活引导(RASteer):先从待保留概念构建保留子空间,用保留正交引导(ROS)从擦除方向中去除与保留子空间对齐的分量,再用重叠自适应校准(OAC)按每层、每去噪步中擦除方向与保留子空间的重叠程度控制共享分量的去除量,从而在擦除目标概念与保留其他内容之间取得更好平衡;在多个骨干与基准上的不安全内容、实例与艺术风格擦除实验中,RASteer 匹配或超越所评估的激活引导与权重编辑基线。
Figure 1: Erasure–preservation trade-offs in steering. (a) Collateral damage from original-direction steering (top) and incomplete erasure under full projection (bottom). (b) Fractions of activations above each threshold. (c) Target and mean retained CLIP accuracy for Snoopy erasure.
arXiv深度剖析
提出免训练的 RASteer,把概念擦除从“只依据目标概念构造擦除方向”改为同时显式建模待保留概念,从而缓解擦除方向中共享分量对非目标内容的抑制。 既有激活引导方法主要从目标概念构建擦除方向并在推理时沿该方向调整激活,而 RASteer 额外从待保留概念构建保留子空间,使擦除方向更具目标特异性。 摘要层面的方法描述与实验陈述;在不安全内容、实例与艺术风格擦除任务、多个骨干与基准上报告匹配或超越所评估的激活引导与权重编辑基线。
提出保留正交引导(ROS),从擦除方向中移除与保留子空间对齐的分量,使引导更专注于目标概念。 相对直接沿原始擦除方向引导,ROS 通过正交化显式削减与保留概念共享的成分。 摘要给出的方法机制说明;具体消融与量化结果未在摘要文本中给出。
提出重叠自适应校准(OAC),在每一层与每个去噪步依据擦除方向与保留子空间的重叠程度,控制每个共享分量的去除比例,以平衡擦除强度与概念保留。 针对“完全去除共享分量会削弱擦除”的问题,OAC 以重叠度为调节信号,而非固定地全部去除。 摘要给出的方法机制说明;逐层与逐步调节的具体实现细节与超参数未在摘要文本中呈现。
在多种擦除场景与多个骨干、基准上,RASteer 在所评估的激活引导与权重编辑基线中达到匹配或更优表现,并在擦除与保留之间取得更好平衡。 把评估扩展到不安全内容、实例与艺术风格三类擦除任务,并同时对比激活引导与权重编辑两类基线。 摘要层面的实验结论陈述;具体指标数值、基准名称与统计细节未在摘要文本中给出。
启示与展望
该工作面向预训练文本到图像扩散模型的概念擦除场景,适用于需要移除目标概念(如受版权保护的风格、可识别角色或不安全内容)同时保持其他内容生成能力的部署与治理需求。方法为免训练、推理时激活引导,因此对使用者而言无需重新训练模型即可应用;摘要所述评估覆盖不安全内容、实例与艺术风格三类擦除任务,并在多个骨干与基准上与激活引导及权重编辑基线比较。其结论适用于这些已评估的骨干、基准与概念类型所构成的设定。
摘要未给出具体评价指标、数值结果、骨干与基准清单,也未说明 ROS 与 OAC 各自的消融贡献,因此难以判断两个机制分别带来多少增益。逐层与逐步的重叠度如何计算、去除比例如何参数化,以及擦除强度与保留质量之间的权衡曲线,仍需在正文中确认。此外,摘要未讨论方法在未见概念类型或不同扩散架构上的表现,这些可作为后续观察方向。
