BMC Geriatrics 2026年9月16日该研究以20个标准化老年药物治疗情景(虚构72–88岁老年人,覆盖四个临床领域,每个情景含三种潜在不适当用药和一项START类遗漏,锚定AGS Beers标准与STOPP/START第3版)让GPT-5.2、Claude Sonnet 4.5和Gemini 3 Pro在相同主提示与默认终端设置下作答,由两名对模型身份设盲的老年医学专家用100分评分表(输出质量0–80分、关键安全风险优先级0–20分)独立评分,发现第一阶段条目层面与答案要点的一致性普遍很高、模型间区分度有限,而专家评定的总分存在显著差异(p<0.001;Kendall's W=0.700),Gemini 3 Pro最高(97.93±2.33)该研究以20个标准化老年药物治疗情景(虚构72–88岁老年人,覆盖四个临床领域,每个情景含三种潜在不适当用药和一项START类遗漏,锚定AGS Beers标准与STOPP/START第3版)让GPT-5.2、Claude Sonnet 4.5和Gemini 3 Pro在相同主提示与默认终端设置下作答,由两名对模型身份设盲的老年医学专家用100分评分表(输出质量0–80分、关键安全风险优先级0–20分)独立评分,发现第一阶段条目层面与答案要点的一致性普遍很高、模型间区分度有限,而专家评定的总分存在显著差异(p<0.001;Kendall's W=0.700),Gemini 3 Pro最高(97.93±2.33)大语言模型老年用药审查输出的质量与安全性:两阶段情景化基准评价该研究以20个标准化老年药物治疗情景(虚构72–88岁老年人,覆盖四个临床领域,每个情景含三种潜在不适当用药和一项START类遗漏,锚定AGS Beers标准与STOPP/START第3版)让GPT-5.2、Claude Sonnet 4.5和Gemini 3 Pro在相同主提示与默认终端设置下作答,由两名对模型身份设盲的老年医学专家用100分评分表(输出质量0–80分、关键安全风险优先级0–20分)独立评分,发现第一阶段条目层面与答案要点的一致性普遍很高、模型间区分度有限,而专家评定的总分存在显著差异(p<0.001;Kendall's W=0.700),Gemini 3 Pro最高(97.93±2.33)该研究以20个标准化老年药物治疗情景(虚构72–88岁老年人,覆盖四个临床领域,每个情景含三种潜在不适当用药和一项START类遗漏,锚定AGS Beers标准与STOPP/START第3版)让GPT-5.2、Claude Sonnet 4.5和Gemini 3 Pro在相同主提示与默认终端设置下作答,由两名对模型身份设盲的老年医学专家用100分评分表(输出质量0–80分、关键安全风险优先级0–20分)独立评分,发现第一阶段条目层面与答案要点的一致性普遍很高、模型间区分度有限,而专家评定的总分存在显著差异(p<0.001;Kendall's W=0.700),Gemini 3 Pro最高(97.93±2.33)