跳到主要内容
返回时间线
Anesthesiology来源发表:

多中心数据驱动的多模态人工智能危重症患者死亡预测模型:开发与外部验证

核心概要

该研究利用MIMIC-III、MIMIC-IV、eICU与HiRID四个公开重症监护数据库共203,434例ICU入院记录(2001至2022年,覆盖200余家医院),开发并外部验证了一个多模态深度学习模型,仅使用ICU入科后首个24小时内可获得的时间不变变量、时间序列变量、临床文本记录与胸部X线图像,预测此后住院死亡风险;仅用结构化数据时模型AUROC为0.92(95% CI 0.90至0.93)、AUPRC为0.53(95% CI 0.49至0.57)、Brier分数为0.19(95% CI 0.18至0.20),在eICU八个机构外部验证AUROC为0.84至0.92,而在同时具备临床记录与影像的患

Source-provided article image: Development and External Validation of a Multimodal Artificial Intelligence Mortality Prediction Model of Critically Ill Patients Using Multicenter Data.
Fig. 1 ·

Fig. 1. Open multimedia modal Schematic of the multimodal deep-learning model for predicting mortality after 24 h of inpatient data. The architecture of our multimodal deep-learning model consists of four component models: (1) a multilayer perceptron for time-invariant variables; (2) a bidirectional long short-term memory model for time-variant data and time-series vital sign variables; (3) a BERT language model for clinical notes; and (4) a DenseNet convolutional neural network for chest x-ray imaging. Model outputs are then unified into a classification model that predicts the outcome. Generalizability, bias/fairness, and explainability were addressed. BERT, bidirectional encoder representations from transformers; CNN, convolutional neural network; EHR, electronic health record; LLM, large language model; LSTM, long short-term memory.

PubMed

深度剖析

构建了一个整合四类数据模态的多模态深度学习死亡预测模型:时间不变变量经多层感知机处理、时间变异量经双向长短期记忆网络处理、临床记录经预训练BERT语言模型处理、胸部X线经DenseNet121卷积网络处理,各组件输出嵌入经池化层拼接后进入分类头输出死亡概率。 既往ICU结局深度学习模型多依赖单一模态的电子病历结构化数据,该工作将结构化时序数据、非结构化文本与影像在同一架构中统一建模,并明确以入科后首个24小时为唯一预测时间点。 模型架构、各组件层数与激活函数、训练策略(Xavier初始化、加权随机采样与加权交叉熵、Adam/AdamW优化器、早停与检查点)在方法部分有完整描述,数据协调代码公开于GitHub仓库。

在仅使用结构化数据时,模型在MIMIC-III与MIMIC-IV内部验证中AUROC达0.92(95% CI 0.90至0.93)与0.92(95% CI 0.91至0.93),并在eICU、HiRID及2020至2022年新冠时期MIMIC人群中完成外部验证,eICU整体AUROC为0.87(95% CI 0.86至0.87),八个机构间AUROC为0.84至0.92。 该研究将外部验证扩展到时间上分离的MIMIC人群、瑞士HiRID单中心数据以及覆盖208家医院的美国多中心eICU数据,提供了跨地域与跨时期的泛化性证据。 样本量为203,434例ICU入院,死亡率在四个数据集中为5.2%至7.9%,置信区间由1,000次自助重采样计算,AUROC比较采用DeLong检验。

在同时具备临床记录与胸部X线的9,881例MIMIC-IV子集中,加入文本与影像使AUROC由0.87(95% CI 0.85至0.89)提升至0.89(95% CI 0.87至0.91),AUPRC由0.43(95% CI 0.36至0.51)提升至0.48(95% CI 0.40至0.56),Brier分数由0.37(95% CI 0.36至0.39)改善至0.17(95% CI 0.16至0.19)。 该分析量化了非结构化文本与影像相对于结构化时序数据的增量预测价值,并显示单独使用胸部X线(AUROC 0.76,95% CI 0.721至0.794)或单独使用临床记录(AUROC 0.77,95% CI 0.735至0.811)均低于结构化时序数据(AUROC 0.87,95% CI 0.847至0.897)。 AUROC差异经DeLong检验P=0.0167,全部模态组合与仅时间变异量比较P=0.017;作者说明因多重检验需要,未对F1、AUPRC与Brier分数进行模型间统计比较。

模型性能优于现有临床严重度评分:在MIMIC-III中表现最佳的SAPS-II AUROC为0.75(95% CI 0.73至0.77)、AUPRC为0.22(95% CI 0.19至0.25),而包含这些评分作为输入的深度学习模型AUROC为0.92(95% CI 0.91至0.93)、AUPRC为0.53(95% CI 0.49至0.57),AUROC差异P<0.05。 该比较将多模态深度学习模型与SOFA、SAPS-II、OASIS、APACHE-II四个已被广泛验证的评分系统置于同一数据与同一评价框架下对照。 比较在MIMIC-III与MIMIC-IV两个数据集上呈现一致趋势,并附有模型与SAPS-II预测不一致病例的补充分析。

启示与展望

该模型设计用于ICU入科后首个24小时这一单一预测时间点,输入仅限该窗口内已知的数据,因此其预期用途是结局基准比较与姑息治疗或目标治疗讨论的早期触发,而非贯穿整个ICU住院过程的连续预警;外部验证仅覆盖结构化数据模态,因为eICU与HiRID不含临床记录与胸部X线,文本与影像的增量价值仅在MIMIC-IV内部子集中评估;作者提出未来需重新设计更动态的模型以服务连续预警,并需在真实临床环境中开展前瞻性验证。

读者仍需留意:模型仅在一个时间点预测,作者指出随预测窗口延长(1天内、7天内、7天后)性能逐步下降;合并症以二分类记录、未含严重度分级;研究基于回顾性数据,可能存在缺失数据与未测量变量混杂,需前瞻性验证;公平性分析显示对75岁以上人群假阳性率较高、对MIMIC-IV中白人人群假阴性率较高,作者提示年龄可能作为衰弱等未测量变量的替代指标;撤除治疗相关文本审计仅识别出1.6%的记录与1.5%的患者, hospice 信息仅在一个数据集中覆盖约2%的患者,这些敏感性分析结果可能受限于事件数量;此外,补充图表与补充表格中的完整性能指标未随正文一并加载,若需逐项核对各模态指标需查阅补充材料。

来源