PrivTab 将差分隐私机制嵌入表格基础模型架构,在 33 个 TabArena 数据集上于中强隐私区间超越 DP-LR 与 DP-MLP,并将拟合时间从数分钟压缩至约 10 毫秒
核心概要
作者提出 PrivTab,一种将差分隐私机制嵌入架构的表格基础模型:它在模拟数据上预训练,通过上下文学习把敏感行压缩为紧凑的可证明私有摘要,在 33 个 TabArena 分类数据集、六个隐私区间上于中强隐私下优于 DP-LR 与 DP-MLP,保持良好校准,并将拟合时间从数分钟降至约 10 毫秒的单次前向传播。
Figure 1 : Alternative approaches to tabular prediction from sensitive data. a , Private learning trains a new model on each sensitive dataset, requiring relatively slow dataset-specific optimisation. b , Non-private tabular learning fits new datasets in a single forward pass through in-context learning, but retains sensitive data for prediction. c , PrivTab instead releases a reusable private summary in one forward pass; all subsequent predictions are private due to the post-processing property of DP. Dashed lines mark the privacy boundary, and stopwatches indicate relative rather than measured time. d , Qualitative comparison; green ticks, orange crosses and grey dashes denote presence, absence and non-applicability, respectively. The auditability comparison concerns the complete data-dependent path, including hyperparameter tuning and privacy accounting, rather than an isolated private update ( Ponomareva et al., 2023 ; Papernot and Steinke, 2022 ; Ganev et al., 2025 ) . e , Membership-inference attack accuracy for the most vulnerable record of each method. For each record in the dataset, we compute the lower endpoint of the 95% confidence interval for attack accuracy; the bar shows the maximum of these lower endpoints. An accuracy of 50% corresponds to perfect privacy. TabPFN v3 and TabICL v2 approach 100%, whereas PrivTab remains much closer to perfect privacy (50%) at the displayed strong and weak formal privacy levels.
arXiv深度剖析
PrivTab 把隐私机制放在敏感信息进入模型的位置,用差分隐私多头交叉注意力(DP-MHCA)把敏感上下文数据集压缩为固定大小的私有摘要,其敏感度不随上下文规模增长。 既有表格基础模型(TabPFN、TabICL)在推理时仍需保留敏感上下文行或其非私有表示,缺乏形式化隐私保证;传统私有学习则依赖逐数据集的 DP 随机优化。PrivTab 改为在架构内部一次性生成可复用的私有摘要。 论文给出单层敏感度定理(Theorem S3.1)与整体 -GDP 的自适应组合定理(Theorem S3.2),并在 Lean 4 中形式化验证敏感度界与 GDP 组合,另配合实现检查与经验审计。
在 33 个 TabArena 分类数据集、六个隐私区间、每个数据集十次 80/20 上下文—目标划分上,PrivTab 在中强隐私区间取得更高准确率与更好的对数损失,聚合 Elo 评分最高。 DP-MLP 仅在弱隐私约束下缩小差距;PrivTab 的优势在强噪声下的对数损失上最明显,说明嵌入隐私机制的训练有助于在隐私界最紧时保留可靠的不确定性估计。 对比对象为经调优的 DP-LR 与 DP-MLP,二者对每个数据集和隐私级别用 DP 随机优化训练;PrivTab 无需任何数据集特定优化。
PrivTab 将拟合时间从数分钟降至约 10 毫秒的中位数,整个基准上 DP-LR 与 DP-MLP 分别消耗约 400 与 130 GPU 小时,而 PrivTab 仅需 30 GPU 秒。 传统方法需为 198 个数据集—隐私配置各做重复训练与私有模型选择(每配置十次划分共 1,980 次最终训练),PrivTab 的同一预训练变体可跨隐私级别复用,无需重训。 运行时在单块 Nvidia V100 上以相同软硬件设置测量,包含数据传输与计算;基线计时含私有学习率选择与训练。
在 Maternal Health Risk 临床记录上的似然比成员推断攻击中,TabPFN v3 与 TabICL v2 对最脆弱记录的拟合攻击准确率下界接近 100%,而 PrivTab 在所有评估隐私级别上更接近完美隐私。 该审计以记录级脆弱性而非聚合平均报告,避免掩盖高脆弱记录;同时论文指出经验攻击不能替代形式化证明。 在全部 1,014 行上生成 4,000 次平衡上下文抽样(每次 507 行),各方法使用相同成员掩码,并采用有限总体校正与 delta 方法估计置信区间。
启示与展望
该工作面向需要在敏感表格数据上做分类、又缺乏隐私专业知识的领域实践者,以及希望以标准 CPU 硬件部署预测的下游用户。其设计使敏感数据集一旦转为私有摘要,后续预测即为后处理、不再消耗隐私预算,摘要可存储并共享供后续预测使用;同一预训练变体可跨隐私级别复用而无需重训。私有预处理实验表明,在具有足够详细的公开列描述、且特征数适中的数据集上,可从公开描述推断裁剪区间并完成端到端私有流程。
论文仅研究分类而非回归;隐私模型假设每行对应一个用户,扩展到一人多行的设定比基于 DP 随机优化的方法更不直接。PrivTab 在隐私较弱或上下文规模较大时相对优势较小,因为逐数据集训练的模型能更多受益于放宽的隐私约束与额外数据。私有预处理实验展示了一种可行路径,但合适的预处理流程仍依赖具体应用,且同样的预处理要求也适用于私有学习基线。经验攻击与形式化验证均不能完全替代对实际运行系统的验证,形式化对象与运行实现之间的对应仍需实现层面的审查。
