多模态匿名化器:用于医疗数据去标识化的全本地多智能体AI系统
核心概要
该研究开发并评估了Multimodal Anonymizer——一个模块化、可本地部署的多智能体框架,整合多模态大语言模型、任务专用神经网络与规则化转换,在涵盖文本、表格、PDF、影像、元数据、文件名、音频、手写与3D影像的基准上,最佳本地配置(编排器为Qwen3-VL-235B-A22B-Thinking)取得每患者98.80%(95%-CI 97.20; 100)的去标识化敏感度与99.60%(95%-CI 98.80; 100)的关键临床内容保留率,在Charité本地250份产程图数据上敏感度与关键临床保留率均为100%,并在多数模态上优于既有工具。
深度剖析
提出并验证了一个统一的多智能体去标识化框架,将MLLM上下文推理、任务专用神经网络(如微调RetinaNet用于3D头部影像去面部、微调ResNet-UNet用于人脸检测、微调TrOCR用于手写识别)与规则化转换(正则日期检测与患者特异性±3年日期平移)整合为单一流水线,并配有迭代验证智能体。 既有方法多为模态特异且缺乏上下文感知,无法处理跨模态嵌入的标识符;该工作将三类计算策略整合为可编排的统一系统,并覆盖文本、表格、PDF、影像、元数据、文件名、音频、手写与3D影像等模态。 在250例MIMIC-IV患者(注入合成PII并具精确标注)加模态特异数据集与250份Charité产程图上评估,最佳配置每患者敏感度98.80%(95%-CI 97.20; 100)、每PII敏感度99.82%(95%-CI 99.76; 99.88),所有模态敏感度下界95%-CI不低于98.30%;主要结局由两名独立专家人工复核。
在去标识化敏感度之外同步量化临床内容保留,报告关键临床保留率99.60%(95%-CI 98.80; 100,每患者)与临床保留率99.61%(95%-CI 99.51; 99.71,每文件),全部数据集中仅识别出一例关键临床信息丢失(一份出院记录中一种活性药物成分被遮蔽)。 以往评估多聚焦敏感度,该工作将披露风险与数据效用作为联合结局,并按患者层级聚合以反映累积再识别风险,同时以日期平移保留纵向时间结构。 关键临床保留与临床保留由两名独立专家人工评审,分歧经讨论解决;Charité本地数据上关键临床保留为100%每患者、临床保留99.97%(95%-CI 99.91; 100)每文件。
系统以完全本地、即插即用的方式部署,代码公开于GitHub并提供浏览器界面,用户仅需配置本地MLLM端点、上传文件、下载保留原目录结构的压缩输出,无需编程经验。 在满足数据驻留与机构控制要求的前提下,将多模态去标识化从分散的模态特异工具集合转变为统一机构工作流。 开源模型在16块NVIDIA H200 GPU集群本地部署,GPT-5.2仅作为经安全Azure部署的上界比较器;提供文档、提示词、模型设置与包版本。
系统在多数模态上优于既有工具,且领先本地模型在去标识化敏感度上与专有模型GPT-5.2相近而特异性更高。 在表格、影像、手写、德文文本与GRASCCO等模态上相对Presidio、ORB-HD与scitlab取得显著更高的去标识化敏感度,并支持后者不支持的元数据与文件名去标识化及日期平移。 配对自助法比较显示,表格敏感度优于Presidio(Δ 4.61% ± 3.91; 5.30)与scitlab(Δ 27.18% ± 26.60; 27.75),影像敏感度优于Presidio(Δ 61.24% ± 57.86; 64.58)与scitlab(Δ 23.62% ± 23.08; 24.04);GPT-5.2总体敏感度最高但特异性最低(77.37%),显著低于GLM-4.6V(Δ -15.50% ± -17.41; -13.38)。
启示与展望
该结果面向需要在机构内部安全复用多模态临床数据的研究与临床数据治理场景,适用于具备本地GPU资源、可部署开源MLLM并遵循HIPAA安全港等去标识化标准的机构;框架输出保留原始文件格式与目录结构,并可选保留连接去标识化与原始数据的关联文件,便于在受治理环境中开展二次使用。
基准主要依赖MIMIC-IV加合成标识符注入,虽能提供精确真值,但可能未完全覆盖常规临床中自然出现标识符的变异性;跨机构、语言、专科与文档类型的泛化仍需进一步验证。残余再识别风险无法完全消除,尤其是通过罕见临床特征或外部数据源的关联。最佳性能需要大量计算资源。数据效用由保留指标推断,尚未在下游建模任务中直接检验。此外,本次加载的文本为快速解析版本,部分图表与补充材料未完整呈现,可能影响对个别结果细节的核对。
