利用大语言模型从MIMIC-IV临床记录中提取结直肠癌症状
核心概要
该研究以MIMIC-IV中2,704份结直肠癌出院记录为数据,用46项症状清单(源自MSAS与EORTC QLQ-CR29)在200份双人裁定金标准上比较了词典规则匹配、预训练临床命名实体识别、零样本Claude Haiku与Gemini 3.5 Flash以及两种“LLM+规则否定过滤”混合方案,结果显示Gemini 3.5 Flash表现最佳(Macro F1=0.70、Micro F1=0.86、Macro Precision=0.74),Claude Haiku次之(Macro F1=0.63、Macro Recall=0.71),两者均明显优于规则法(Macro F1=0.44)与NER(Macro F1=0.
深度剖析
在同一患者群体、同一46症状清单和同一专家裁定金标准下,零样本LLM的症状提取性能显著高于词典规则匹配与预训练临床NER。 此前研究多单独报告某一类方法的可行性,缺少在同一金标准上对规则、NER与LLM三类方法的直接横向基准比较;本文以2,704份记录为背景、200份裁定记录为评测集完成了这一比较。 基于200份双人独立标注并联合裁定的金标准(9,200个症状-记录对,合并kappa=0.71、宏平均kappa=0.49),采用Macro/Micro F1、精确率与召回率,并用McNemar检验配合Bonferroni校正(校正α=0.003)做配对比较。
在LLM输出之上叠加固定窗口的规则否定过滤会降低性能,主要因为假阴性大幅增加。 该混合方案是作为探索性分析设计的,用于检验规则否定过滤能否在提示已包含上下文判断的情况下进一步提升精确率;结果显示其反而覆盖了原本正确的LLM预测。 混淆矩阵显示Claude假阴性由53升至163、Gemini由54升至167,同时假阳性下降(Gemini+Hybrid FP=75);文中以“no relief from nausea”“patient denies any improvement in abdominal pain”等实例说明固定100字符窗口无法区分真正的否定与含否定词的阳性表述。
症状层面的提取难度并不均匀,通用“疼痛”与部位特异性疼痛条目之间的类别边界在自由文本中难以一致应用。 研究把聚合指标拆解到单个症状,指出通用疼痛(金标准患病率18.0%)的F1仅为Claude 0.47、Gemini 0.50,而abdominal_pain(0.94/0.98)与anal_rectal_pain(0.86/0.96)均超过0.85。 该模式在人类标注者之间同样出现:疼痛的kappa=0.52(中等),低于abdominal_pain的0.79与anal_rectal_pain的0.86,提示这是症状分类体系本身的模糊性。
金标准的可靠性本身随症状患病率变化,稀有症状的评估需要谨慎解读。 研究同时报告了合并kappa(0.71)与宏平均kappa(0.49)的差异,并说明六个零患病症状使所有方法的F1必然为0,从而机械性拉低宏平均F1。 9,200个症状-记录对中仅277个(3.0%)不一致;20个症状kappa≥0.60,12个症状kappa<0.20但原始一致率仍达94–99%,符合低患病率下的kappa悖论;五个症状因双方均无阳性标注而kappa不可估计。
启示与展望
该结果面向使用常规出院记录进行肿瘤症状监测的研究者与临床信息学团队,适用于以MSAS与EORTC QLQ-CR29合并得到的46项症状清单、且症状信息主要记录在Chief Complaint与History of Present Illness部分的场景;方法在零样本设置下运行,无需机构特定规则开发或模型再训练,因此便于在具备相应数据使用协议的环境中复现与扩展。
读者仍会关注:在更大且稀有症状代表性更充分的评测集上,宏平均F1会如何变化;通用疼痛与部位特异性疼痛的类别边界能否通过更明确的标注规则或提示设计得到一致处理;专有模型的版本更替(文中提到Gemini 2.5 Flash在研究期间被Gemini 3.5 Flash取代)与云端API传输临床文本对可复现性和数据治理的影响;以及本地可部署的开源权重模型能否提供更持久且更保护隐私的替代方案。此外,本文为预印本,尚未经过同行评审,且图1与图2的具体数值未在文本中逐项列出,因此症状层面的细节只能依据正文与补充表推断。
