跳到主要内容
返回时间线
Heart & Lung来源发表:

多模态大语言模型在院前心电图判断急诊导管室启动上的表现:一项回顾性对比分析

核心概要

该研究对270例疑似急性心肌梗死患者的院前急救场景中采集的615份心电图进行回顾性分析,以心内科实际启动STEMI通路作为参考标准,比较三种多模态大语言模型与心电图机算法的判读表现,发现Gemini敏感度最高(95.3%)但特异度极低(9.4%),ChatGPT与Claude敏感度中等(68.1%与67.2%)且特异度有限(42.3%与46.5%),而心电图机算法敏感度67.7%、特异度64.2%,表现更为均衡,提示通用大语言模型在时间敏感的急诊流程中不适合用于基于心电图的导管室启动决策。

AI-generated editorial illustration: Large language models fail to reliably predict emergent catheterization laboratory activation from prehospital electrocardiograms.

深度剖析

研究以真实世界心内科启动STEMI通路进行急诊造影这一决策为参考标准,评估多模态大语言模型对院前心电图的判读能力。 以往对心电图自动判读的评估多与心电图诊断标签比较,本研究将对照锚定在真实临床启动决策上,使评估更贴近急诊流程中的实际使用场景。 回顾性分析,样本为270例急救患者接触中的615份心电图,参考标准为心内科启动STEMI通路,属于真实世界决策基准。

三种多模态大语言模型在敏感度与特异度之间呈现明显失衡:Gemini敏感度95.3%(95% CI 91.7-97.3)但特异度仅9.4%,ChatGPT与Claude敏感度分别为68.1%和67.2%,特异度分别为42.3%和46.5%。 该结果量化了不同模型在院前心电图这一具体任务上的假阳性倾向差异,补充了通用模型在临床判读任务中的性能画像。 报告了敏感度、特异度及Gemini敏感度的95%置信区间,样本量明确,模型数量为三个。

心电图机算法在敏感度67.7%(95% CI 61.4-73.4)与特异度64.2%之间取得更均衡的表现,特异度高于所有被测大语言模型。 提供了同一批院前心电图上的机器算法对照,使大语言模型的表现可被置于既有临床工具的参照系中理解。 与三种大语言模型在同一数据集、同一参考标准下直接比较,并给出敏感度置信区间。

研究结论认为,尽管部分模型敏感度较高,但特异度不足导致过多的假阳性启动建议,通用大语言模型不适合用于基于心电图的导管室启动决策。 将模型性能差异转化为对急诊工作流程适用性的判断,指出高敏感度并不足以支撑时间敏感场景中的部署。 结论基于上述敏感度、特异度、阳性预测值、阴性预测值与总体准确率的计算,属于回顾性对比分析层面的证据。

启示与展望

该研究界定了通用多模态大语言模型在院前心电图判读中的适用范围:其评估场景为疑似急性心肌梗死的急救患者接触,参考标准为心内科启动STEMI通路,比较对象为三种大语言模型与心电图机算法。这一结果可帮助急诊与心内科团队在考虑将大语言模型纳入院前分诊或启动建议环节时,明确其当前定位应限于辅助而非替代既有判读工具;对于希望进一步探索模型在特定阈值或人机协同流程下表现的研究者,本研究提供了可对照的基线数据。

读者仍需关注:本研究为回顾性分析,其结论在实时临床环境中的表现有待前瞻性验证;不同模型版本、提示方式或图像输入条件是否影响判读结果,原文未展开;此外,由于本次加载内容为摘要层面的文本,缺少图表与完整方法细节,关于阳性预测值、阴性预测值与总体准确率的具体数值、以及模型间差异的统计比较方式,仍属开放问题,需查阅原文以获取完整信息。

来源