基于常规电子健康记录数据的院内谵妄预测模型:系统综述
核心概要
该系统综述检索PubMed、MEDLINE、Embase、PsycINFO与Web of Science(自建库至2025年11月11日),纳入29项使用常规采集的电子健康记录或行政数据开发、验证或评估成人住院期间急性精神状态恶化(均操作化为谵妄)多变量预测模型的研究,按CHARMS与TRIPOD/TRIPOD-AI提取数据、以PROBAST评估偏倚风险,发现证据集中于入院或早期风险分层、围手术期或术后预测、重症监护动态预测以及既有工具的外部验证或工作流评估四类任务,多数为回顾性队列(20/29,69%),机器学习或混合方法常见(18/29,62%)但未稳定优于统计或规则方法,24项(83%)报告
PRISMA (Preferred Reporting Items for Systematic Reviews and Meta-Analyses) flow diagram of study selection [ 9 ].
PubMed深度剖析
该综述将院内谵妄EHR预测模型的证据归纳为四类相互重叠的预测任务:入院或早期住院风险分层、围手术期或术后预测、重症监护病房动态预测,以及既有工具的外部验证或工作流评估。 相对以往零散的单模型报告,这里以预测任务而非单一算法为组织线索,把不同临床场景下的模型放在同一框架内对照。 基于29项符合纳入标准的研究,采用CHARMS与TRIPOD/TRIPOD-AI指导数据提取,并以PROBAST评估偏倚风险与适用性。
机器学习或混合方法在该领域已较常见(18/29,62%),但更复杂的模型并未稳定优于统计或规则类方法。 这一观察把“模型复杂度”与“实际预测增益”区分开来,提示方法选择本身不构成性能保证。 来自对29项研究的叙述性综合,其中多数为回顾性队列(20/29,69%)。
报告完整性呈现明显不均衡:内部区分度报告于24项研究(83%,AUC范围0.77-0.97),外部区分度12项,校准15项,决策曲线分析仅3项,前瞻性评估或工作流整合仍然有限。 该综述把“区分度”与“校准、临床效用、外部与前瞻验证”分开计数,使读者能看到证据链中哪些环节被反复报告、哪些环节稀少。 计数直接来自29项纳入研究的提取结果,性能、验证、校准与实施特征以叙述性方式综合。
总体偏倚风险为低8项、不明确10项、高11项,主要源于分析域局限;作者据此认为常规EHR数据可支持跨医院场景的谵妄风险预测,但尚无单一算法可常规采用。 把偏倚风险评估与临床就绪度判断并列呈现,为“能否部署”提供了比单纯性能指标更完整的判断依据。 偏倚风险与适用性由PROBAST评估,结论建立在29项研究的整体分布之上。
启示与展望
该综述面向使用常规采集EHR或行政数据、预测成人住院期间谵妄的研究者与临床信息学团队,其结论适用于普通病房、混合病房-重症监护、重症监护及急诊等已纳入场景的风险预测设计;作者建议未来研究在建模前先定义预期临床用途,并在区分度之外评估校准与临床效用,再跨机构、跨时间段与跨工作流进行检验后才考虑部署。
读者仍需留意:各研究对结局的确定方式不一致,预测任务异质,校准与决策分析报告偏少,外部与前瞻性评估有限;此外本次可获取内容为摘要层面的文本,未包含各研究的图表与逐项数据,因此无法进一步核对单个模型的变量、样本量与具体校准结果,这些细节有待查阅原文。
