medRxiv 2026年9月16日该研究在耶鲁纽黑文健康系统三家医院共1,412份心导管操作记录上,用人工标注作为参考标准,评估了三个开源大语言模型(Llama 3.3 70B、Meditron-7B、BioMistral-7B)识别经皮冠状动脉介入治疗(PCI)报告并抽取六项复杂PCI特征的能力,结果显示Llama 3.3 70B在多数任务上优于两个较小的医学领域模型,PCI识别达到100.0%敏感度、93.8%特异度、96.4%准确度和95.9% F1,复杂PCI分类在590份可评估报告中达到97.7%敏感度、80.1%特异度、57.6%阳性预测值、99.2%阴性预测值和83.9%准确度,且在明确记录的变量(如支架数量和支架长度)上该研究在耶鲁纽黑文健康系统三家医院共1,412份心导管操作记录上,用人工标注作为参考标准,评估了三个开源大语言模型(Llama 3.3 70B、Meditron-7B、BioMistral-7B)识别经皮冠状动脉介入治疗(PCI)报告并抽取六项复杂PCI特征的能力,结果显示Llama 3.3 70B在多数任务上优于两个较小的医学领域模型,PCI识别达到100.0%敏感度、93.8%特异度、96.4%准确度和95.9% F1,复杂PCI分类在590份可评估报告中达到97.7%敏感度、80.1%特异度、57.6%阳性预测值、99.2%阴性预测值和83.9%准确度,且在明确记录的变量(如支架数量和支架长度)上用大语言模型从心导管报告中自动识别复杂经皮冠状动脉介入治疗该研究在耶鲁纽黑文健康系统三家医院共1,412份心导管操作记录上,用人工标注作为参考标准,评估了三个开源大语言模型(Llama 3.3 70B、Meditron-7B、BioMistral-7B)识别经皮冠状动脉介入治疗(PCI)报告并抽取六项复杂PCI特征的能力,结果显示Llama 3.3 70B在多数任务上优于两个较小的医学领域模型,PCI识别达到100.0%敏感度、93.8%特异度、96.4%准确度和95.9% F1,复杂PCI分类在590份可评估报告中达到97.7%敏感度、80.1%特异度、57.6%阳性预测值、99.2%阴性预测值和83.9%准确度,且在明确记录的变量(如支架数量和支架长度)上该研究在耶鲁纽黑文健康系统三家医院共1,412份心导管操作记录上,用人工标注作为参考标准,评估了三个开源大语言模型(Llama 3.3 70B、Meditron-7B、BioMistral-7B)识别经皮冠状动脉介入治疗(PCI)报告并抽取六项复杂PCI特征的能力,结果显示Llama 3.3 70B在多数任务上优于两个较小的医学领域模型,PCI识别达到100.0%敏感度、93.8%特异度、96.4%准确度和95.9% F1,复杂PCI分类在590份可评估报告中达到97.7%敏感度、80.1%特异度、57.6%阳性预测值、99.2%阴性预测值和83.9%准确度,且在明确记录的变量(如支架数量和支架长度)上