人工智能评估腹腔镜胆囊切除术中的Parkland分级:迈向真实世界结局预测的一步
核心概要
该研究在一个常规运行的手术人工智能平台上,对249例连续腹腔镜胆囊切除术自动赋予Parkland分级评分,并按低危(PGS 1-2,n=78)与高危(PGS 3-5,n=171)分组比较手术结局,同时以两名外科医生对75例视频样本的独立双次复核作为真值,评估模型的F1分数、区分度(AUC 0.932与0.896)与校准度,结果显示高危组在年龄、ASA评分、胆囊炎比例、急诊手术比例、手术时长、术中事件、中转补救、住院天数及90天主要并发症与再入院方面均更高,且在病例对照匹配(n=84)后手术时长与出血相关事件仍保持显著差异。
深度剖析
该平台在真实临床流程中自动完成Parkland分级评分,高危组(PGS 3-5)占68.7%,低危组(PGS 1-2)占31.3%。 此前PGS多用于人工分级或回顾性研究,这里展示了在常规视频采集流程中自动赋分的可行性。 基于249例连续病例的连续入组数据,分组比例明确。
模型对PGS的估计与外科医生真值高度一致,高危F1=0.96、低危F1=0.93,区分度AUC为0.932与0.896,校准度良好并在PGS=3处达到峰值。 提供了以两名外科医生独立双次复核(n=75)为真值的模型性能量化,而非仅依赖单一评分者。 真值来自两名外科医生的独立重复复核,性能指标分别对每位评分者计算。
高危组与更差的围手术期结局相关:手术时长57.6对35.3分钟、术中事件80.1%对61.5%、中转补救10.5%对0、住院2天对1天、90天主要并发症与再入院10.5%对2.6%。 将自动分级与真实世界结局指标直接关联,而不仅是分级本身的一致性。 多项比较均报告p值(多数p<0.001,并发症与再入院p=0.04)。
在病例对照匹配(n=84)平衡潜在混杂因素后,手术时长(平均秩49.51对35.49,p=0.008)与出血相关事件(平均秩46.0对39.0,p=0.047)仍保持显著。 提示分级与部分结局的关联不完全由基线混杂解释。 匹配后样本量较小,仅两项结局保持显著。
启示与展望
该结果适用于在常规视频采集条件下运行的腹腔镜胆囊切除术场景,面向希望以自动化分级辅助围手术期风险分层的外科团队与平台开发者;其价值在于把PGS评分与手术时长、术中事件、住院时长及90天并发症等真实世界结局联系起来,为后续前瞻性验证与临床框架整合提供基础。
读者仍会关注:模型在不同机构、不同视频质量与不同病例构成下的表现是否稳定;匹配后仅84例的样本对出血相关事件等次要结局的估计精度如何;PGS=3处校准峰值对临床决策阈值的实际含义;以及从相关性走向结局预测所需的进一步验证路径。本次为摘要级阅读,未获取图表与补充材料,上述关于校准曲线形态与匹配细节的问题仍属开放。
