跳到主要内容
返回时间线
arXiv来源发表:

DP-RGMI 框架在 59.4 万张胸片上把差分隐私的性能损失拆成编码器几何与任务头利用两部分

核心概要

作者提出 DP-RGMI 框架,把差分隐私训练视为表征空间的结构化变换,用表征位移、谱有效维度和线性探针与端到端 AUROC 之差(利用差距)三个量来分解隐私带来的性能下降;在 PadChest 主数据集(110,525 张正位胸片、22,045 张测试图)以及 CheXpert、ChestX-ray14 等共超过 594,000 张胸片、三种预训练初始化(ImageNet、DINOv3、MIMIC-CXR)上,他们发现强隐私下线性可分性大体保留但利用差距持续存在(如 ImageNet ε=1.0 时 G=8.0,MIMIC ε=0.7 时 G=3.4,DINOv3 ε=0.7 时 G=6.1),而位移与谱有效维度呈非单调、依赖初始化与

Source-provided article image: Differential Privacy Representation Geometry for Medical Image Analysis
Fig. 1

Fig. 1. Overview of DP-RGMI framework decomposing DP training into representation displacement ∆(ε), spectral structure deff(ε), and utilization gap G(ε).

· 第 3 页

深度剖析

DP-RGMI 把差分隐私下的性能下降分解为编码器几何(表征位移 Δ、谱有效维度 d_eff)与任务头利用(线性探针 AUROC 与端到端 AUROC 之差 G)两部分。 此前医学影像中的隐私—效用权衡几乎只用 AUROC 或 Dice 等端到端指标评估,无法区分隐私噪声是削弱线性可分性、重塑表征几何,还是主要损害任务头优化;该框架首次把这三者拆开并给出可复现的诊断流程(Algorithm 1)。 框架定义明确、模型与数据集无关,只需嵌入向量和标准评估指标;在 PadChest 主数据集与两个泛化数据集上按同一协议执行,并用 1000 次自助法给出不确定性。

在强隐私下,线性探针 AUROC 始终高于端到端 AUROC,即存在稳定的利用差距 G,说明可判别结构仍保留在私有编码器中但未被联合训练充分利用。 非隐私基线 G(∞)≈0,而隐私下 G 显著为正(ImageNet ε=1.0 时 8.0,MIMIC ε=0.7 时 3.4,DINOv3 ε=0.7 时 6.1),把“隐私导致表征塌缩”的笼统解释替换为“表征保留、利用不足”的可测量区分。 PadChest 测试集 22,045 张图像、1000 次自助重采样,报告均值±标准差;CheXpert 与 ChestX-ray14 上重复同一协议后仍观察到正的 G(ε)。

表征位移与谱有效维度在隐私下呈非单调、依赖初始化与数据集的轨迹,而非一致退化。 ImageNet 初始化下 d_eff 在中等隐私时下降(ε=8.6 时 3.4)而在更强隐私时上升(ε=1.0 时 9.2),DINOv3 随隐私增强趋于更低有效维度(5.1→3.9),MIMIC 则逐步上升;位移幅度与效用也不单调对应。 三种初始化在 PadChest 上的 Δ 与 d_eff 数值(如 DINOv3 Δ=1.9、MIMIC 从 Δ=0.1 升至约 1.3–1.4)以及 CheXpert、ChestX-ray14 上的轨迹图共同支持。

利用差距与端到端性能的关联在数据集间稳健,但随初始化变化;几何量则捕捉额外的先验与数据集条件化变异。 跨数据集 AUROC 与 G 呈负相关(PadChest ρ=−0.95、CheXpert ρ=−0.86、ChestX-ray14 ρ=−0.98),但跨初始化时 ImageNet 为 ρ=−0.78、MIMIC 为 ρ=−0.31、DINOv3 为 ρ=+0.55;MIMIC 初始化下 Δ 与 AUROC 的 ρ=+0.81。 Spearman 秩相关基于每个设置 n=9、总体 n=27 的隐私预算×数据集/初始化组合;作者明确说明 G 与 AUROC 的关联部分源于其定义,按描述性而非因果解读。

启示与展望

该框架面向需要在跨机构复用、迁移学习或冻结特征提取场景中选择隐私预算的医学影像研究者与部署者,适用于多标签胸片分类这类可获取嵌入向量与标准评估指标的设置;它按构造与模型、数据集无关,作者预期在任何表征被复用或微调的场景都会出现类似的几何—利用交互。实际使用时,若两个隐私预算端到端 AUROC 相近但其中一个 G 更大,框架提示可恢复信号仍在,可优先测试冻结编码器、只重训任务头或调整任务头参数的裁剪等优化侧干预,而不是放松隐私;若 Δ 很大而探针性能稳定,则提示表征已明显偏离预训练先验,可能影响跨机构迁移或复用;若 d_eff 明显下降,则提示谱集中度上升、表征多样性下降,可能限制对新任务的适应,此时更应考虑重新审视预训练或隐私强度。

作者指出,G 与 AUROC 的关联部分来自 G 的定义本身,因此按描述性而非因果解读;相关分析中每个设置仅 n=9、总体 n=27,初始化间符号甚至反转(ImageNet ρ=−0.78 对 DINOv3 ρ=+0.55),提示这种关系依赖预训练先验。隐私保证按图像而非按患者施加,因为训练样本对应单张胸片,这一粒度对临床解读的影响值得关注。全部实验限于单一 ConvNeXt-Small 骨干,作者说明这是受约束的选择:批归一化与 DP-SGD 的逐样本梯度不兼容,而 transformer 在 DP 优化下不稳定;框架在其他任务(如分割)中的行为尚待验证。此外,只重训任务头这类干预的隐私成本尚未量化,被作者列为直接的后续工作。

来源