优化大语言模型用于医院出院预测:一项回顾性队列研究与推理期优化策略评估
核心概要
这项在单一三级学术医疗中心开展的回顾性队列研究,利用2024年入院、住院时长2至14天的成人住院患者随机划分出的验证集(n=860)与测试集(n=886),让大语言模型基于06:00索引时点前30小时的临床文书预测当日出院,发现基线GPT-5提示在验证集上F1为0.48、敏感度为0.37,定性错误分析显示错误最多来自运营流程而非医学知识,而在三种推理期优化策略中,自动提示优化在留出测试集上取得更高的F1与敏感度(但阳性预测值与特异度更低),测试时扩展与专家主导的提示工程改进甚微。
深度剖析
研究给出了大语言模型当日出院预测的基线性能画像:基线GPT-5提示在验证集上F1为0.48、敏感度为0.37,并按F1、平衡准确率、敏感度、特异度、阳性预测值、阴性预测值多指标评估。 此前出院预测研究多报告模型性能,但较少以统一的多指标框架刻画通用大语言模型在当日出院这一具体任务上的基线表现。 基于随机生成的验证集(n=860)与测试集(n=886)两个独立队列,样本量明确、指标预先设定,属于回顾性队列设计下的定量评估。
通过临床落地的定性错误分析,研究识别出运营流程是模型错误最常见的来源,而非单纯的医学知识不足。 把错误分析从笼统的准确率讨论推进到可归类的错误域,指出错误集中在运营流程层面。 定性错误分析在2025年6月至12月期间开展,属于对模型输出的人工归类分析,结论以错误域分布形式呈现。
在三种推理期优化策略中,自动提示优化在留出测试集上比基础提示取得更高的F1与敏感度,但阳性预测值与特异度更低;测试时扩展与专家主导的提示工程改进甚微。 把优化尝试限定在推理期而非重新训练,并直接比较三类策略在同一留出测试集上的表现差异。 策略比较在独立留出测试集(n=886)上进行,报告了F1、敏感度、阳性预测值、特异度等多维指标,显示提升伴随指标间的权衡。
自动提示优化把大语言模型的出院预测性能提升到既往出院预测方法所报告的范围之内。 将通用大语言模型经推理期优化后的表现与既有出院预测文献的性能区间做了对照。 该结论来自本研究的留出测试集结果与既往报告范围的比较,属于回顾性单中心数据下的对照性陈述。
启示与展望
该研究面向的是单一三级学术医疗中心、2024年入院且住院时长在2至14天之间的成人住院患者,预测任务限定为基于06:00索引时点前30小时临床文书的当日出院判断,因此其结论适用于这一机构与人群设定下的推理期优化评估。对希望借鉴该框架的读者而言,它提供了可复用的评估指标组合(F1、平衡准确率、敏感度、特异度、阳性预测值、阴性预测值)、随机划分验证集与测试集的流程,以及三类推理期优化策略的比较范式,便于在其他机构或队列中检验自动提示优化是否同样带来F1与敏感度提升并伴随阳性预测值与特异度的下降。
读者仍会关注若干开放问题:自动提示优化带来的F1与敏感度提升伴随阳性预测值与特异度下降,这一权衡在不同阈值与不同临床使用场景下如何取舍;运营流程作为最常见错误来源,其具体错误域构成与可干预环节在本文摘要层面未展开;此外,本次可获取的文本为摘要性内容,缺少图表与完整结果表,因此各指标在测试集上的具体数值、置信区间以及策略间差异的统计显著性无法在此确认,这些都需要回到原文核对。
