跳到主要内容
返回时间线
medRxiv来源发表:

用大语言模型从心导管报告中自动识别复杂经皮冠状动脉介入治疗

核心概要

该研究在耶鲁纽黑文健康系统三家医院共1,412份心导管操作记录上,用人工标注作为参考标准,评估了三个开源大语言模型(Llama 3.3 70B、Meditron-7B、BioMistral-7B)识别经皮冠状动脉介入治疗(PCI)报告并抽取六项复杂PCI特征的能力,结果显示Llama 3.3 70B在多数任务上优于两个较小的医学领域模型,PCI识别达到100.0%敏感度、93.8%特异度、96.4%准确度和95.9% F1,复杂PCI分类在590份可评估报告中达到97.7%敏感度、80.1%特异度、57.6%阳性预测值、99.2%阴性预测值和83.9%准确度,且在明确记录的变量(如支架数量和支架长度)上

AI-generated editorial illustration: Automated Identification of Complex Percutaneous Coronary Intervention from Cardiac Catheterization Reports Using Large Language Models

深度剖析

在1,412份心导管记录(其中596份为PCI报告)上,Llama 3.3 70B对PCI识别的表现为100.0%敏感度、93.8%特异度、96.4%准确度和95.9% F1,且在三家医院均保持较高准确度(约97.1%、100.0%、95.5%)。 此前一项针对PCI操作变量的研究标注PCI记录数量较少,且所用大语言模型并非开源;本研究样本更大、采用可在本地安全环境部署的开源模型,并覆盖三家记录结构不同的医院。 以四位介入心脏病学fellow标注、再由一位委员会认证介入心脏病学家复核形成的参考标准为对照,在1,386份可评估报告上计算敏感度、特异度、阳性预测值、阴性预测值、准确度和F1,并给出95% Wilson置信区间。

在590份可评估PCI报告中,Llama 3.3 70B对复杂PCI分类达到97.7%敏感度、80.1%特异度、57.6%阳性预测值、99.2%阴性预测值、83.9%准确度和72.5% F1,并在每家医院都取得最高准确度(约75.6%、77.7%、88.2%)。 该研究把抽取目标聚焦于Giustino等定义的复杂PCI这一需要领域判断的操作表型,而非仅识别表层实体,并同时报告了各分项标准的二分类表现。 复杂PCI状态在六项标准中至少一项为阳性时判为阳性,仅当六项标准全部可得且均为阴性时判为阴性,否则判为不确定;该规则分别应用于参考标准和模型抽取结果,仅在两者均可判定时评估分类表现。

抽取准确度随变量类型明显分化:Llama 3.3 70B对支架数量(96.8%)、分叉病变双支架(96.5%)、总支架长度(93.8%)和血管数量(90.1%)的精确匹配准确度较高,对病变数量(80.7%)和慢性完全闭塞(85.1%)较低。 研究将变量按文档特征与推理需求分层,指出明确记录、数值化的变量更易直接抽取,而需要跨段落整合与临床定义判断的变量准确度下降。 精确匹配准确度按每个变量在可评估报告中的匹配比例计算,并给出95% Wilson置信区间;同时报告了各分项标准的敏感度、特异度、阳性预测值、阴性预测值、准确度和F1。

两个较小的医学领域模型表现明显不同:Meditron-7B在PCI识别上敏感度87.2%但特异度仅7.8%,BioMistral-7B敏感度1.2%而特异度99.4%;在复杂PCI分类上BioMistral-7B仅有51份可评估报告,其估计需谨慎解读。 该对比提示,在本任务中模型容量与通用语言推理能力可能比单纯的医学领域预训练更重要,且小模型在罕见标准上可通过大量判为阴性获得较高表观准确度。 三个模型使用同一提示模板、仅做推理不做微调,均在本地NVIDIA A100上运行;Meditron-7B与BioMistral-7B采用4-bit量化和确定性解码,报告了完整的混淆矩阵计数与各项指标。

启示与展望

该结果面向回顾性、单健康系统内三家医院的心导管报告,适用于以Giustino等定义的六项标准刻画复杂PCI表型的研究与质量测量场景,并支持在本地安全计算环境中使用开源模型进行推理。研究提示,明确记录、数值化的变量(如支架数量与支架长度)最适合直接抽取,而需要跨段落整合与临床定义判断的变量(如病变数量、分叉病变PCI、慢性完全闭塞)更适合与规则逻辑或后处理约束结合的混合流程。

读者仍会关注:在更广泛卫生系统与不同文档实践下的外部验证结果;前瞻性验证与人在回路流程中的表现;当相关信息分散于长文档或需要识别缺失信息时性能如何变化;以及抽取变量的小幅误差在风险建模或比较效果研究中如何传播。此外,本文为预印本,尚未经过同行评审,且原始数据因隐私与伦理审查限制未公开,仅提供代码链接;分项标准的完整指标与混淆矩阵位于补充材料中,若未获取补充材料,对个别标准层面的解读会受限。

来源