跳到主要内容
返回时间线
medRxiv来源发表:

大语言模型从MIMIC-IV临床记录中提取的结直肠癌症状群及其与患者结局的关联

核心概要

该研究使用零样本大语言模型流程(Gemini 3.5 Flash 与 Claude Haiku)从 MIMIC-IV 中 1,507 名结直肠癌患者的 2,728 份出院记录里提取 46 种症状,基于 phi 相关(≥0.10)与 Louvain 社区检测构建患者层面症状共现网络,两种模型均收敛于三个临床可解释的症状群——全身性、结直肠癌疾病特异性与胃肠道症状群,且全身性症状群负担与院内死亡(OR=1.33)和 1 年死亡(OR=1.41)相关、结直肠癌疾病特异性症状群负担与 30 天再入院(OR=1.20)相关,这些关联在调整转移性疾病后依然稳健。

AI-generated editorial illustration: Large Language Model-derived Symptom Clusters and Patient Outcomes in Colorectal Cancer from MIMIC-IV Clinical Notes

深度剖析

从非结构化出院记录中由大语言模型提取的症状可重建出三个临床可解释的症状群:全身性、结直肠癌疾病特异性与胃肠道症状群。 既往结直肠癌症状群研究主要依赖患者自报量表在离散时点的评估,本研究改为使用常规诊疗中产生的电子健康记录自由文本,并通过大语言模型零样本抽取症状后做网络分析。 基于 1,507 名患者、2,728 份出院记录;抽取方法此前已在 200 份人工标注金标准上做过基准测试(最佳模型 Macro F1=0.70);两种独立大语言模型(Gemini 3.5 Flash 与 Claude Haiku)得到一致的三群结构,跨模型 Adjusted Rand Index=0.727。

三个症状群在多种敏感性分析下可重复:100 个 Louvain 随机种子下平均 ARI=0.985,200 次自助重抽样中 96.0% 恢复三群解(平均 ARI=0.733),胃肠道症状群在两种模型间成员完全一致。 此前较少有研究系统检验大语言模型抽取症状所构建网络的稳定性;本研究预先设定并报告了相关阈值、随机种子、笔记聚合策略与自助重抽样四类敏感性分析。 phi 阈值 0.10 与 0.15 下均得到三群解(但成员构成变化,ARI=0.438),0.20 时网络碎裂为五群;跨模型差异仅集中在少数边界症状(出汗、嗜睡、头晕、排尿问题)的重新分配。

症状群负担具有独立预后价值:全身性症状群负担预测院内死亡(OR=1.33,95% CI 1.18–1.49)与 1 年死亡(OR=1.41,95% CI 1.27–1.56),结直肠癌疾病特异性症状群负担独立预测 30 天再入院(OR=1.20,95% CI 1.08–1.34)。 既往研究多止步于症状群的识别与描述,本研究进一步将每个症状群的负担评分同时纳入逻辑回归,检验其对三类临床结局的预测效度。 N=1,507,结局发生率分别为院内死亡 10.3%、30 天再入院 27.1%、1 年死亡 15.5%;模型同时纳入三个症状群负担并调整年龄与性别,上述关联在额外调整转移性疾病后依然稳健。

结直肠癌疾病特异性症状群负担与 1 年死亡呈反向关联(OR=0.85,调整转移性疾病后 OR=0.83),且该反向关联集中于转移性疾病患者(OR=0.81),而转移性疾病在该症状群负担更高者中反而更常见(负担 0 时 43.5%,负担 3 时 78.8%)。 作者检验并报告了“疾病分期混杂”这一替代解释,发现数据不支持该解释,从而提出以症状表达形式(离散可处理的肠道症状 vs 全身性衰退)来理解这一反向模式的假设。 转移性疾病本身是 1 年死亡的强预测因子(OR=4.57,95% CI 3.17–6.58);反向关联在调整后增强而非减弱,且在转移亚组内仍显著,作者据此说明该模式并非由疾病较轻所致。

启示与展望

该结果适用于在单一学术医疗中心接受诊疗、以出院小结形式记录症状的结直肠癌住院患者,症状来自主诉与现病史部分,采用零样本大语言模型抽取并以 phi 相关与 Louvain 社区检测构建患者层面网络。它使后续工作可以在同一类电子健康记录文本上开展可扩展的症状表型刻画,并把症状群负担评分作为死亡与再入院的候选风险标志;对希望把自动症状画像用于症状评估与患者报告结局监测的临床研究者与护理研究者最为直接相关。作者指出下一步应超越横断面共现,转向纵向症状动态,利用连续电子健康记录笔记识别时间上先行的“哨兵”症状。

症状跨全部出院记录聚合,未考虑时间性,首次出院记录限制下平均症状负担由 4.15 降至 2.73 且多个症状跌破 5% 患病率阈值,因此症状出现与结局之间的时间关系仍是开放问题。心理症状在本次大语言模型网络中不突出,而既往患者自报研究与一项使用 MetaMap 的电子健康记录研究曾识别出焦虑—失眠—乏力—抑郁群,作者提出需要将大语言模型抽取症状与同期患者报告结局直接比较,以区分记录偏倚与抽取误差。phi 相关(≥0.10)与患病率(≥5%)阈值为预先设定而非经验优化,且症状群采用变量中心方法并以未加权负担评分关联结局,与潜在类别分析等个体中心表型在概念上不同。此外,本研究为未经同行评审的预印本,结论来自单一学术医疗中心,跨医疗系统的外部验证尚未完成。

来源