大语言模型数据抽取在NSQIP中展现出准确性与可靠性
核心概要
本研究以105例NSQIP乳房重建试点项目患者(2024年7月1日至2025年2月28日)的临床记录为对象,经人工去标识化后用定制化ChatGPT 4.1工作流逐变量抽取,以整形外科教师作为参考标准,共评估9,048个数据点,结果显示大语言模型总体抽取准确率为99.33%(61个错误),高于人工抽取的98.19%(164个错误),McNemar与卡方检验p<0.001,模型在术中与术后变量上优于人工,在术前变量上略低,最常见错误为既往乳房手术史(29/61)及胸肌前与胸肌下植入物或扩张器位置判断。
深度剖析
在NSQIP乳房重建变量抽取任务中,定制化大语言模型的总体准确率高于常规人工抽取,99.33%(61个错误)对98.19%(164个错误),McNemar与卡方检验均p<0.001。 此前NSQIP数据采集依赖劳动密集的人工病历抽取,本研究将大语言模型逐变量抽取与人工抽取在同一参考标准下直接比较,提供了该场景下的量化准确率对照。 基于105例患者、9,048个数据点的对照评估,以整形外科教师确立的参考标准为基准,并采用McNemar与卡方检验进行统计比较。
大语言模型在术中与术后变量上的表现超过人工抽取,但在术前变量上略低于人工抽取。 说明模型优势并非在所有变量类别上一致,变量类型会改变模型与人工的相对表现。 来自同一批9,048个数据点按变量类别分层的比较结果。
大语言模型最常见的错误集中在既往乳房手术史(61个错误中的29个),其次是胸肌前与胸肌下植入物或扩张器位置判断,后者常需从病历记录中推断。 具体指出模型易错的变量类型,为后续针对需要推断的变量改进抽取流程提供方向。 基于对61个模型错误按变量归类的统计描述。
作者将本研究定位为概念验证性验证研究,认为结果支持大语言模型辅助抽取作为提升效率、降低资源需求并促进NSQIP更广泛实施与扩展的可行路径,同时指出仍需多中心验证。 把单中心的准确率结果转化为对NSQIP数据采集流程效率与可扩展性的应用前景判断。 结论基于单一试点项目的验证性设计,作者明确将多中心验证列为后续必要条件。
启示与展望
本研究适用于NSQIP乳房重建试点项目(2024年7月1日至2025年2月28日)中经人工去标识化的临床记录,以及定制化ChatGPT 4.1工作流所针对的通用与乳房重建NSQIP变量;参考标准由整形外科教师确立。其意义在于为希望以模型辅助替代或补充人工抽取、从而缓解效率与成本压力并减少因人力限制而进行的患者抽样的团队提供依据。作者明确指出,向更广泛实施与扩展推进仍需多中心验证。
读者仍会关注:在需要从记录中推断的变量(如胸肌前与胸肌下植入物或扩张器位置)上,模型表现如何随文档质量变化;既往乳房手术史这一高频错误类别是否可通过提示或流程调整改善;以及作者提出的多中心验证会如何影响准确率与效率结论。本文为研究快报,未提供图表与变量级明细,因此无法进一步核对各变量类别的具体准确率数值。
