加泰罗尼亚多语言电子健康记录中未编码临床特征的本地隐私保护提取:开发与验证研究
核心概要
该研究在机构防火墙内部署3.8B参数的开放权重小语言模型Phi4-mini(经Ollama运行),结合确定性正则表达式后处理,从加泰罗尼亚SIDIAP数据库的15,498份加泰罗尼亚语/西班牙语双语MEAP初级保健叙事中提取发热、亚硝酸盐、白细胞、腰痛、腹痛和血尿六项未编码尿路感染临床特征,在60份真实病历的双盲临床医生金标准验证中达到93.8%准确率、96.6%特异度和83.6%敏感度,在720份对抗性合成文本压力测试中达到87.2%准确率、99.5%特异度和99.2%阳性预测值,全程无患者数据离开机构服务器。
Figure 1. Extraction pipeline scheme
medRxiv · 第 20 页深度剖析
构建并验证了一个完全本地化、隐私保护的混合提取流水线,将概率性小语言模型推理与确定性正则表达式规则相结合,用于从多语言初级保健叙事中提取未编码临床特征。 既往临床自然语言处理多依赖云端商业大语言模型API或针对英语电子健康记录微调的BERT类模型,本研究则采用3.8B参数开放权重模型Phi4-mini在机构防火墙内本地运行,并针对加泰罗尼亚语/西班牙语双语及MEAP半结构化格式进行提示工程与正则后处理。 在60份真实病历的双盲临床医生金标准验证中,总体准确率93.8%(95% CI 90.6%-96.1%)、特异度96.6%(95% CI 93.6%-98.4%)、敏感度83.6%(95% CI 73.0%-91.2%);在720份对抗性合成文本压力测试中,准确率87.2%(95% CI 84.6%-89.6%)、特异度99.5%(95% CI 98.1%-99.9%)、阳性预测值99.2%(95% CI 97.2%-99.9%)。
在2,962名匹配病例对照患者中,流水线共识别出4,663次临床特征出现,且进展为急性肾盂肾炎的病例组特征负担高于对照组。 该研究将提取结果用于ITUCAT观察性研究中的急性肾盂肾炎风险模型富集,展示了未编码叙事数据在真实世界流行病学研究中的可用性。 病例组特征出现比例71.3%对比对照组55.8%(标准化均数差SMD=0.326),其中发热(33.0% vs 9.0%;SMD=0.616)和腰痛(29.0% vs 9.8%;SMD=0.502)差异最为突出。
通过双验证策略(真实世界临床金标准与对抗性合成压力测试)系统评估了流水线在语言噪声、否定陷阱和罕见同义词等边缘情况下的表现。 多数既往研究仅采用单一验证方式,本研究同时提供临床保真度评估和边缘失败模式的严格测试,并额外用Gemma3:4b在同一60份病历上进行比较分析。 真实世界验证中评审者间一致性为84.4%(Cohen's kappa),两个小语言模型间总体Cohen's kappa为66.9(47.4-86.4);Gemma3:4b总体准确率84.9%(80.6-88.5),敏感度97.3%(90.5-99.7),特异度81.4%(76.2-85.9)。
启示与展望
该流水线旨在应用于机构防火墙内部、以加泰罗尼亚语和西班牙语为主的初级保健MEAP叙事提取场景,当前验证局限于尿路感染这一特定临床背景。其模块化设计使提示词和正则表达式可适配新的临床领域或语言,作者提出未来可推广至心血管和呼吸系统疾病等领域,并可用于临床文档质量监测、患者画像或资源规划等常规管理任务。对于面临类似隐私约束的其他医疗系统(如医院框架),该流水线提供了一个可迁移的模板。
读者可能关注以下开放性问题:3.8B参数模型在处理复杂否定、非标准临床简写和叙事噪声时的推理能力边界;正则表达式优先策略在提升特异度的同时可能带来的保守特征捕获倾向;真实世界验证中23份叙事(占验证样本6.4%)因评审者间持续分歧而被排除可能引入的选择偏倚;六项提取变量混合了症状、体征和尿液分析结果,不应被解读为等效的临床表现或独立的肾盂肾炎诊断标准;MEAP记录的完整性和质量高度依赖临床医生个体、每次就诊可用时间及就诊总量,可能影响提取结果的代表性;以及该流水线在尿路感染以外临床领域的泛化能力尚待评估。
