跳到主要内容
返回时间线
Chinese medical journal来源发表:

机器学习用于慢性胰腺炎患者ESWL术后胰腺炎的早期风险分层

核心概要

该研究基于长海医院2016年5月31日至2019年6月26日期间1370例接受体外冲击波碎石术(ESWL)的慢性胰腺炎住院患者的回顾性去标识化临床数据,从109个变量中筛选出55个变量,比较了XGBoost、LightGBM、CatBoost、随机森林、支持向量机、人工神经网络、多层感知机、TabNet、Transformer和Wide&Deep共十种机器学习与深度学习算法在三种建模方案(全部预处理变量、单因素筛选的21个变量、ADASYN过采样训练数据)下的表现,以F1分数为主要选择指标,结果显示TabNet在前两种方案中取得最佳留出测试集表现(F1均为0.71),最终选择更简约的21变量T

Source-provided article image: Machine learning for early post-ESWL risk stratification of pancreatitis in chronic pancreatitis.
Figure 1 ·

Figure 1 Open multimedia modal Model performance and SHAP-based interpretation under different variable-processing strategies. (A) F1-Score results of the model based on the preprocessed variables. (B) F1-Score results of the model based on variables from univariate analysis. (C) F1-Score results of the model based on oversampled variables. (D) SHAP plot of the TabNet model based on preprocessed variables. (E) SHAP plot of the TabNet model based on variables from univariate analysis. (F) SHAP plot of the LGBM model based on oversampled variables. Panels A and D show the results obtained using the preprocessed variables, including the F1-score comparison of 10 machine-learning models on the test set (A) and the SHAP summary plot of the TabNet model (D). Panels B and E show the corresponding results based on variables selected by univariate analysis. Panels C and F show the corresponding results based on the oversampled training dataset, including the F1-score comparison (C) and the SHAP summary plot of the LGBM model (F). In the SHAP summary plots, each point represents one sample; the x-axis indicates the SHAP value (impact on model output), and the color reflects the feature value from low (blue) to high (red). ALP: Alkaline phosphatase; ALT: Alanine aminotransferase; AMS: Amylase; AST: Aspartate aminotransferase; DM: Diabetes mellitus; ESWL: Extracorporeal shock wave lithotripsy; Glu: Glucose; HCT: Hematocrit; PLT: Platelet; RBC: Red blood cell; RP: Recurrent pancreatitis; WBC: White blood cell.

PubMed

深度剖析

研究构建并内部验证了一个基于常规围手术期临床数据的机器学习模型,用于ESWL术后胰腺炎的早期风险分层,填补了此前AI模型多集中于ERCP术后胰腺炎、少有模型识别ESWL术后胰腺炎的空白。 作者明确指出,尽管已有AI模型用于识别ERCP术后胰腺炎,但据其所知尚少有模型用于识别ESWL术后胰腺炎,因此该工作将AI风险分层拓展到ESWL这一具体场景。 基于1370例单中心回顾性队列,其中144例(10.51%)发生术后胰腺炎,采用8:2患者层面划分训练集与留出测试集,并对十种算法进行10折交叉验证比较。

在三种建模方案中,TabNet在全部55个预处理变量和单因素筛选的21个变量两种方案下均取得最佳留出测试集F1分数0.71,而ADASYN过采样方案下LightGBM交叉验证F1高达0.95±0.02但测试集降至0.66,提示过采样未提升泛化性,最终选择更简约的21变量TabNet模型。 通过同时比较变量筛选与过采样两种策略,研究显示单因素筛选(P≤0.1)在保持测试集表现的同时改善了交叉验证稳定性(21变量模型交叉验证F1为0.55±0.09,精确率0.80±0.21,召回率0.43±0.09),而过采样方案出现明显的交叉验证与测试集性能落差。 报告了各方案的交叉验证均值与标准差、留出测试集F1、阳性与阴性类别的召回率和精确率,并附有补充图表与混淆矩阵汇总。

特征重要性与SHAP分析一致识别术后血清淀粉酶为最具影响力的变量,在55变量TabNet模型中重要性为0.15、21变量模型中为0.147,在过采样LightGBM模型中重要性为623;SHAP还显示术后血清淀粉酶、白细胞计数和复发性胰腺炎呈正相关,混合性胰石、术前吲哚美辛使用、脂肪泻和糖尿病呈负相关。 研究强调术后血清淀粉酶在完整诊断标准满足之前即可作为早期生化信号被模型捕捉,支持其用于早期风险分层而非简单的标签泄漏,并提示糖尿病和血糖相关变量的负向SHAP方向应谨慎解读为非线性多变量模型中的条件贡献。 基于SHAP汇总图与补充表格中的特征重要性排序,覆盖三种建模方案。

模型对无并发症患者的排除能力较强(召回率98.38%、精确率96.05%),但对阳性病例的识别能力有限(召回率62.96%、精确率80.95%),作者据此指出该模型更适合ESWL术后早期分诊与监测,而非术前规划。 研究明确界定了模型的适用场景,并指出由于早期术后生化变量对模型性能贡献显著,模型定位为术后早期分诊与监测工具。 基于留出测试集中阳性与阴性类别的召回率和精确率,以及作者对低事件率限制阳性病例预测和严重程度分层的说明。

启示与展望

该研究界定的适用范围是慢性胰腺炎患者接受ESWL后的术后早期阶段,模型定位为早期分诊与监测而非术前规划,因为早期术后生化变量对模型性能贡献显著。研究基于长海医院2016至2019年单中心1370例住院患者的回顾性数据,采用患者层面8:2划分与内部验证,作者明确指出未来需要多中心研究对该框架进行外部验证,并进一步检验仅限术前变量的模型能否支持更早的临床决策。对读者而言,这意味着该结果目前适用于理解单中心数据下常规临床变量与术后淀粉酶在早期风险分层中的潜在价值,而非直接用于其他机构的临床部署。

读者仍需关注若干开放问题:模型仅在单中心内部验证,尚无外部独立队列验证其可移植性;事件率相对较低(144/1370)限制了阳性病例预测与严重程度分层;过采样方案在交叉验证与留出测试集之间出现明显性能落差,提示在该数据集上过采样未改善泛化性;部分围手术期细节与术后症状指标缺失或不完整;糖尿病和血糖相关变量的负向SHAP方向反映的是非线性多变量模型中的条件贡献,作者也提示应谨慎解读。此外,本次加载的文本为快速解析版本,补充图2–7与补充表1–8的具体数值未包含在正文中,若需完整评估模型性能与特征贡献,应查阅补充材料。

来源