跳到主要内容
返回时间线
arXiv来源发表:

UDS 用激活修补量化 LLM 遗忘深度,在 150 个模型、20 项指标中取得最高忠实度与稳健性

核心概要

该工作提出 Unlearning Depth Score(UDS),先用保留模型基线定位编码目标知识的层,再通过激活修补在 0-1 尺度上度量遗忘模型抹除了多少该知识,并在覆盖 8 种方法、150 个已遗忘模型的元评估中与 20 项指标比较,报告 UDS 具有最高的忠实度与稳健性,案例研究显示它能揭示被表征漂移所掩盖、观测类指标看不到的残余知识,且擦除深度随提示类型变化。

Source-provided article image: Measuring the Depth of LLM Unlearning via Activation Patching
Figure 1 ·

Figure 1: Overview of UDS for a single forget set example. (A) Stage 1 patches hidden states from M ret M_{\text{ret}} into M full M_{\text{full}} at each layer to measure how deeply the forget set knowledge is encoded. (B) Stage 2 repeats this with M unl M_{\text{unl}} as source to quantify how much encoded knowledge remains recoverable. (C) Stage 2 degradation is compared against Stage 1 at each layer to compute erasure ratios, which are weighted and aggregated into a single 0–1 score.

arXiv

深度剖析

提出 UDS,一种通过激活修补量化遗忘机制深度的指标,先借助保留模型基线识别编码目标知识的层,再在 0-1 尺度上衡量遗忘模型对该知识的擦除程度。 既有输出层指标无法检测知识仍可从内部表征中恢复的情形,而此前的白盒研究虽能揭示残余知识,却常依赖辅助训练或针对特定数据集的适配,缺少可泛化的指标;UDS 以因果式激活修补给出统一度量。 摘要报告在 8 种遗忘方法、150 个已遗忘模型上对 20 项指标做元评估,UDS 在忠实度与稳健性上最高;具体数值、数据集与统计细节未在给定文本中列出。

案例研究表明 UDS 能发现被表征漂移遮蔽、观测类指标无法显示的残余知识,并且擦除深度随提示类型不同而变化。 这把审计视角从输出行为推进到内部表征层面,说明仅看输出可能低估未真正擦除的知识。 依据摘要所述的案例研究结论;文本未给出案例数量、提示类型清单或量化幅度。

作者给出将 UDS 整合进现有基准测试框架、精简评估流程的指南,并公开代码与数据。 使该指标不止停留在单篇研究,而具备被既有评测流水线采纳的操作路径。 摘要明确提到提供整合指南与代码数据链接;具体指南内容未在给定文本中展开。

启示与展望

该工作面向需要审计 LLM 遗忘效果的场景,例如隐私保护与 AI 安全的事后评估,使用者是构建或运行遗忘基准的研究与工程团队。UDS 的设定是:先以保留模型为基线定位编码目标知识的层,再在遗忘模型上通过激活修补度量擦除比例,输出 0-1 的深度分数;它被设计为可嵌入现有基准框架并精简评估流程。案例研究提示其适用性还取决于提示类型,因为擦除深度会随提示类型变化。

给定文本为摘要级内容,未列出具体指标数值、数据集构成、提示类型清单与统计检验细节,因此 UDS 相对其他指标的优势幅度无法从现有材料判断。元评估中 20 项指标的具体选择与比较条件、以及 UDS 在不同模型规模或领域上的表现,仍是读者需要查阅原文确认的开放问题。此外,擦除深度随提示类型变化这一现象背后的机制,文本未作说明。

来源