TIDE 2.0 将可替换识别器与密钥化匿名器分离,在两家机构语料上实现 0.88 与 0.77 的跨度级召回
核心概要
TIDE 2.0 是一个 MIT 许可、可院内自托管的临床文本去标识引擎,把可替换的 PHI 识别器与密钥化、无映射表的匿名器分离:匿名器用每患者保间隔日期偏移、格式保留加密和确定性密钥选择生成替代值,使同一取值在同一密钥下跨病历一致、换密钥后新旧发布不可关联;默认配置(由大模型蒸馏的 TIDE2-Sentry 加正则层)在 Stanford 的 SHIELD 语料上达到跨度级召回 0.88、精确率 0.88,在另一机构的 i2b2 2014 语料上为 0.77 与 0.87。
Figure 1: One sentence through the pipeline. The recognizer stage detects and types PHI spans and caches them before any text is altered. A reviewer can therefore inspect the detected spans before the anonymizer runs. The anonymizer stage applies a keyed strategy to each category. Both dates move by the same per-patient offset, so the fourteen-day interval between them is preserved. Fig. 4 shows the component-level architecture.
arXiv深度剖析
引擎把识别与匿名拆成两个可独立替换的阶段,二者通过缓存的跨度表示通信,因此站点可以先采用某个识别器、之后再换模型,而无需对已处理病历重新匿名化;识别结果在任何文本被改写前被缓存,便于人工复核模型检出了什么。 此前的开源临床去标识工具把识别器与匿名器耦合,或只做逐篇检测、不提供执行层;TIDE 2.0 把识别器槽位开放给任意 Hugging Face 分词分类器、LLM 识别器、正则与 Aho–Corasick 词典匹配器,并采用 Presidio 兼容接口。 架构与接口在方法部分完整描述;论文在单张消费级 GPU 上做基准测试,并明确说明未报告仓库级部署。
匿名器是密钥化且不存储映射表的:日期按每患者偏移平移并保持所有时间间隔,数字与字母数字标识符用 FF3 格式保留加密,姓名与地点用确定性密钥选择;同一取值在同一密钥下处处得到同一替代值,换新密钥后新旧发布无法相互关联。 作者称此前很少有开源工具能同时生成既真实又在患者病历间一致的替代值;TIDE 1.0 对多数结构化标识符只做删除或用随机值替换。 在每类 2,000 个合成取值的压力集上,确定性、跨病历一致性、换密钥重映射与间隔保持均为 100.0%;碰撞率并非先验保证:3–5 位数字标识符有 34.8%–36.6% 共享替代值,姓名在 2,000 个中碰撞 0.4%、在 20,000 个中碰撞 3.3%。
默认配置(TIDE2-Sentry 加正则层)在 SHIELD 上达到微平均召回 0.88、精确率 0.88,在 i2b2 2014 上为 0.77 与 0.87;跨机构召回下降 0.11,其中 HOSPITAL、ID、PHONE 三类合计贡献 56%,DATE 贡献 33%。 论文以跨度级召回而非 F1 为主要结局,理由是漏检标识符是可报告披露,而假阳性只是替换掉一个临床词;并逐类别报告结果,而非只给一个聚合分数。 两个金标注语料分别来自两家机构(SHIELD 1,381 篇、10,229 个跨度;i2b2 2014 经标签映射后 1,304 篇、27,298 个跨度),置信区间为 2,000 次文档级自助重采样;作者说明未分析漏检跨度,故下降原因只是假设。
TIDE2-Sentry 是由 Gemini 2.5 Flash 在 13,000 篇未标注病历上蒸馏出的 DeBERTa-v3-large 分词分类器;学生模型宏平均召回 0.81,低于教师的 0.90,且在每个类别上都更低。 论文量化了蒸馏保真度,并指出 LOCATION 是教师(0.66)与学生(0.55)共同的最弱类别,说明该类别低召回并非蒸馏独有。 教师在全 1,381 篇 SHIELD 病历上评分;除 WEB 外,各类别师生召回差经 9 类 Bonferroni 校正后仍在 0.05 水平显著,ID 的差异接近该阈值。
启示与展望
该工作面向需要在机构自有硬件上把临床病历转为可研究语料的机构,尤其是关注跨病历纵向分析与发布间不可关联的团队。引擎设计为可读写仓库病历表,但论文只报告单张消费级 GPU 上的基准,未报告仓库级部署。识别器槽位开放,任何 Hugging Face 分词分类器、LLM 识别器或正则与 Aho–Corasick 匹配器都可填入,因此站点可先采用 TIDE2-Sentry,日后换用更强模型而无需重新匿名化已处理病历。匿名器的密钥按研究或租户隔离,换密钥可确定性地重映射全部替代值,使不同密钥下的发布不可相互关联。论文还给出跨机构召回下降的逐类别分解,可用于判断迁移到新站点时哪些类别需要本地词典或格式支持。
论文未在去标识语料上运行下游表型或时间推理实验,因此效用保持是由构造论证并经结构验证,下游等价性未被证明。吞吐量来自单机单次运行,CPU 路径是未调优的单 actor 配置,未跨多节点、未测量阶段重叠、未测试工作节点失败恢复。学生模型训练于 13,000 条教师生成的银标签,论文未对照金标准刻画这些标签的噪声,因此教师系统性误差对学生的影响未被量化;蒸馏病历与两个语料在病历层面不相交,但未核实患者层面是否与 SHIELD 不相交。AIMI 识别器也训练于 i2b2 2014,故该语料对它们并非留出集,论文据此不用于两者排序。i2b2 中的标识符本身是替代值,其召回可能与真实标识符不同。标签映射决策是在可访问两个语料的条件下做出的,不做边界对齐时 i2b2 微平均召回为 0.69 而非 0.77。六个外部标注器在临床文本上属分布外,仅作稳健性探针。论文未报告 LLM 识别器对比,提示词只针对教师模型开发。匿名器检查是合成取值上的单元级测试,未对发布运行链接或重识别攻击,也未测试替代值是否让漏检标识符更难被发现;成员推断不在范围内。密钥化院内替代降低但不消除重识别风险,不提供差分隐私式的形式化保证,论文也不主张满足 HIPAA Safe Harbor 或 k-匿名。
