面向临床决策的语言模型微调、检索增强生成与混合适配:系统综述
核心概要
该研究遵循PRISMA 2020指南检索PubMed/MEDLINE、Scopus与Web of Science(2018年1月至2026年5月),从1890条记录中纳入35项2024至2026年发表的研究,按微调或参数高效微调(7/35,20%)、检索增强生成(17/35,48.6%)与混合方法(11/35,31.4%)分组进行描述性综合,发现微调在窄任务分类中表现突出(如癌症检测AUC最高0.912、重性抑郁障碍预测AUC 0.892),检索增强生成提升指南依从性与诊断准确性(分别由71.1%升至92.1%、由78.9%升至94.7%)但在更大推理型模型上收益不一致,混合系统在复杂临床流程中表现最
PRISMA (Preferred Reporting Items for Systematic Reviews and Meta-Analyses) flow diagram of study identification, screening, eligibility assessment, and the inclusion process for the systematic review.
PubMed深度剖析
该综述按增强策略对临床语言模型适配研究进行了系统归类,给出微调、检索增强生成与混合方法各自的证据分布。 此前关于临床语言模型适配的比较性证据不清晰,本文以PRISMA 2020流程检索三大数据库并纳入35项研究,明确三类策略的占比与领域覆盖。 系统综述方法学,检索1890条记录后纳入35项研究,覆盖肿瘤学、神经病学、放射学、精神健康、心脏病学、眼科学与外科护理等多个专科。
微调在任务特异性应用中表现强劲,检索增强生成提升指南依从性与诊断准确性,混合系统在复杂临床流程中总体表现最强。 本文把策略与任务类型对应起来,提出微调适合窄分类、检索增强生成适合指南依据的推理、混合方法适合复杂多模态任务。 报告了具体性能数值,包括癌症检测AUC最高0.912、重性抑郁障碍预测AUC 0.892、指南依从性由71.1%升至92.1%、诊断准确性由78.9%升至94.7%,以及卒中分诊、皮肤科、多模态影像与肿瘤学外部验证准确率超过90%;但检索增强生成的收益在更大推理型模型上不一致。
该综述使用PROBAST+AI评估偏倚风险,指出当前证据基础以回顾性或基准测试为主。 在综合性能证据的同时给出方法学质量画像,25项研究为高偏倚风险、9项为不明确风险、仅1项为低风险。 常见问题包括外部验证不足、缺少校准评估、参与者选择不具代表性以及分析方法报告不充分;作者据此提出需要前瞻性研究、外部验证、校准与标准化安全性报告。
启示与展望
该综述面向需要为临床诊断与决策支持任务选择后训练适配策略的研究者与临床信息学团队,其结论适用于按任务类型匹配策略这一层面:窄分类任务可考虑微调,需要依据指南进行推理的任务可考虑检索增强生成,复杂多模态任务可考虑混合方法。所纳入证据来自2024至2026年发表的35项研究,覆盖多个专科,因此结论的适用范围以这些已发表研究的情境为限。
读者仍需关注的是:检索增强生成的收益在更大推理型模型上并不一致,这一差异的具体条件有待进一步说明;纳入研究以回顾性或基准测试为主,外部验证、校准评估与安全性报告的标准化程度有限,因此从这些结果到前瞻性临床应用的过渡仍需更多证据;此外,本次可获取内容为摘要层面的文本,未包含图表与附录细节,若需核对各研究的具体设计、样本与统计方法,应查阅原文全文。
