用现成大语言模型全自动抽取纵向乳腺肿瘤病历变量
核心概要
该研究开发了一套符合HIPAA要求的开源流程,在100例复杂乳腺肿瘤患者(中位病历超过3100页、中位随访6.5年、中位7线治疗)中,用未经微调的现成商用大语言模型从原始未标注的临床笔记、病理报告和用药记录中抽取诊断与复发日期、临床分期、生物标志物亚型、基因检测结果及系统治疗信息,最佳模型在复发状态(99%)、胚系BRCA1/2致病变异(100%)、激素受体(99%)、HER2(96%)、临床分期(91%)、PIK3CA(91%)和ESR1(90%)上与专家一致性很高,抗癌药物抽取接近肿瘤科医生间差异,但精确治疗线重建的患者层面表现仍比第二位肿瘤科医生低9个百分点,四个模型在系统治疗抽取上均优
深度剖析
在固定检索流程中,现成商用大语言模型无需微调或机构专属再训练,即可从复杂纵向肿瘤病历中抽取多类关键变量,性能接近肿瘤科医生之间的差异。 此前病历抽象多依赖人工或需要针对机构数据训练模型,这里展示的是通用现成模型在HIPAA合规环境下直接处理未归一化、未标注、未编辑的原始文本。 基于100例随机抽取的复杂乳腺肿瘤患者,以乳腺肿瘤科医生抽象结果作为参考标准,并报告了逐变量一致性百分比。
在系统治疗抽取上,所有四个受测大语言模型均优于研究协调员,最佳模型接近肿瘤科医生间差异。 把模型表现同时放在第二位肿瘤科医生和研究协调员两个比较基准上,而不只是与单一参考标准比较。 系统治疗抽取设置了第二位肿瘤科医生和研究协调员作为对照,报告了模型与协调员的相对表现。
由大语言模型生成的数据集与专家生成的数据集给出相似的复发无生存、总生存和风险比估计。 把评估从变量层面推进到下游生存分析层面,说明抽象误差未必改变流行病学结论。 在同一批100例患者上比较专家来源与模型来源数据集的生存与风险比估计。
在97例年轻早期乳腺癌外部队列中,未经修改的流程在复发检出和辅助内分泌治疗使用上表现相似。 提供了机构外队列的初步验证,提示流程不依赖单一机构的病历格式。 外部队列97例,评估复发检出与辅助内分泌治疗使用两项任务。
启示与展望
该结果适用于在HIPAA合规环境中、以固定检索流程处理复杂纵向乳腺肿瘤病历的场景,目标是抽取诊断与复发日期、临床分期、生物标志物亚型、基因检测结果和系统治疗等变量;外部验证限于97例年轻早期乳腺癌患者的复发检出与辅助内分泌治疗使用。精确治疗线重建仍是表现相对较低的任务,提示该流程更适合变量级与生存分析级的数据集构建,而非逐线治疗的完全替代。
原文为快速解析版本,缺少图表与补充材料,因此无法核对逐变量置信区间、模型版本细节、提示词设计、错误类型分布以及外部队列的完整变量范围;精确治疗线重建低于第二位肿瘤科医生9个百分点这一差距在何种临床或研究用途下可接受,仍需结合具体分析目标判断;不同机构病历格式、语言与编码习惯对流程的影响也有待更多外部验证。
