聊天机器人对“反酸”问题的回答是否准确充分:一项由患者与医生评分的盲法比较
核心概要
该研究将39个关于“反酸”(烧心/消化不良/胃食管反流病)的常见患者问题分别提交给ChatGPT-5、Gemini-2.5和Claude-4,由3名胃肠病学家就准确性、全面性、共情和可操作性评分,由20名患者就共情、全面性、可操作性、关怀和有用性评分,并分析可读性指数,结果显示模型间在医生评分的多个维度存在显著差异,Gemini-2.5和Claude-4在准确性、全面性和可操作性上高于ChatGPT-5,Claude-4共情得分最高,患者对各模型的可理解性评分普遍较高,但认为Gemini-2.5和Claude-4的回答比ChatGPT-5更具可操作性,ChatGPT-5的回答可读性最好(约相当
深度剖析
在医生评分中,Gemini-2.5和Claude-4在准确性、全面性和可操作性上的平均得分高于ChatGPT-5(P < 0.05),Claude-4的共情得分最高。 此前对LLM用于胃肠道健康信息的担忧集中在准确性、共情、可操作性和可读性,但缺少针对“反酸”这一具体患者问题、并由胃肠病学家盲法评分的多模型直接比较。 由3名胃肠病学家对39个常见问题的回答独立评分,并报告了模型间差异的统计学显著性(P < 0.05)。
患者评分显示所有模型的可理解性普遍较高,但Gemini-2.5和Claude-4的回答被认为比ChatGPT-5更具可操作性。 将患者视角与医生评分并列,补充了以往多依赖专家或自动指标评估LLM患者教育内容的做法。 由20名患者就共情、全面性、可操作性、关怀和有用性进行评分。
可读性分析显示ChatGPT-5的回答最易读,约相当于高中阅读水平,而Gemini-2.5和Claude-4生成的内容语言更复杂。 揭示了模型间在可读性与医生评分维度之间存在取舍:医生评分较高的模型其语言复杂度也更高。 基于对三个模型回答的可读性指数分析。
启示与展望
该研究适用于“反酸”(烧心/消化不良/胃食管反流病)相关的常见患者问题场景,面向关注AI辅助患者教育的临床医生、患者教育设计者和模型选择者;其结论提示在胃肠病学患者教育中可考虑模型选择与混合方法,但结果基于39个问题、3名胃肠病学家和20名患者的评分,是否适用于其他疾病主题或其他患者群体需进一步研究。
读者可能关注:各模型在准确性、全面性、共情、可操作性等维度的具体平均分及分布未在文本中给出;可读性分析所用具体指数未说明;39个问题的选取标准、患者与医生的评分一致性、以及“反酸”之外的胃肠道问题是否呈现相同模式,均属可进一步观察的方向。
