跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

BMC Geriatrics

大语言模型老年用药审查输出的质量与安全性:两阶段情景化基准评价

该研究以20个标准化老年药物治疗情景(虚构72–88岁老年人,覆盖四个临床领域,每个情景含三种潜在不适当用药和一项START类遗漏,锚定AGS Beers标准与STOPP/START第3版)让GPT-5.2、Claude Sonnet 4.5和Gemini 3 Pro在相同主提示与默认终端设置下作答,由两名对模型身份设盲的老年医学专家用100分评分表(输出质量0–80分、关键安全风险优先级0–20分)独立评分,发现第一阶段条目层面与答案要点的一致性普遍很高、模型间区分度有限,而专家评定的总分存在显著差异(p<0.001;Kendall's W=0.700),Gemini 3 Pro最高(97.93±2.33)