大语言模型老年用药审查输出的质量与安全性:两阶段情景化基准评价
核心概要
该研究以20个标准化老年药物治疗情景(虚构72–88岁老年人,覆盖四个临床领域,每个情景含三种潜在不适当用药和一项START类遗漏,锚定AGS Beers标准与STOPP/START第3版)让GPT-5.2、Claude Sonnet 4.5和Gemini 3 Pro在相同主提示与默认终端设置下作答,由两名对模型身份设盲的老年医学专家用100分评分表(输出质量0–80分、关键安全风险优先级0–20分)独立评分,发现第一阶段条目层面与答案要点的一致性普遍很高、模型间区分度有限,而专家评定的总分存在显著差异(p<0.001;Kendall's W=0.700),Gemini 3 Pro最高(97.93±2.33)
深度剖析
研究提出并实施了一个两阶段评价框架:第一阶段考察模型输出与显式处方标准答案要点的条目层面一致性,第二阶段探索性地刻画具有临床情境的错误模式。 既往对LLM用药审查的评估多停留在与处方标准清单的条目匹配,该工作把“答对条目”与“专家评定的推理质量与安全优先级”分开测量,从而能观察到两者并不一致。 基于20个标准化情景、统一主提示、默认终端设置、禁用记忆功能并对每个情景使用独立会话,由两名设盲老年医学专家用100分评分表独立评分,评分者间可靠性ICC(A,2)=0.935(95% CI 0.897–0.957)。
条目层面一致性普遍很高且模型间区分度有限,但专家评定的输出质量总分在三个模型间存在显著差异。 说明仅凭与答案要点的一致性无法区分模型,而专家评分能揭示差异,提示评估维度需要扩展。 总分差异p<0.001、Kendall's W=0.700,所有两两比较均显著且标准化效应量大(r=0.55–0.61);Gemini 3 Pro为97.93±2.33(95% CI 96.83–99.02),Claude Sonnet 4.5为93.90±3.37,GPT-5.2为89.85±5.23。
安全性优先级评分呈现与总分相同的模型排序,且模型间在安全优先级上存在差异。 把“关键安全风险优先级”作为独立于一般输出质量的评分维度,并显示其能区分模型。 安全评分差异p<0.001、Kendall's W=0.861、r=0.52–0.62,排序与总分一致。
探索性错误分析显示被标记错误的模式在模型间不同。 提示除得分高低外,错误类型分布也是模型间差异的一个可观察维度。 Gemini在浅层推理、对危及生命风险强调不足及任何被标记错误上被标记频率低于GPT-5.2,在对危及生命风险强调不足及任何被标记错误上低于Claude Sonnet 4.5;该分析被作者定位为探索性。
启示与展望
该结果适用于情景化基准这一设定:虚构的72–88岁老年人、四个临床领域、每个情景含三种潜在不适当用药与一项START类遗漏、锚定AGS Beers标准与STOPP/START第3版、统一主提示与默认终端设置。它支持在监督下使用LLM辅助用药审查,并支持把推理质量与安全优先级纳入评估设计;对希望建立临床LLM评价流程的老年医学、临床药学与临床信息学团队具有直接参考价值。
作者将第二阶段错误分析定位为探索性,其错误类型分布结论宜作为待进一步验证的观察;情景为虚构且样本为20个,模型排序在不同情景集、不同提示或不同临床领域下是否稳定仍是开放问题;此外,本次加载内容为摘要层面的文本,缺少图表与完整方法细节,评分表各条目权重、错误标记的具体判定规则以及情景构建过程无法从现有文本核实,这些是读者需要留意的开放点。
