World Journal of Methodology 该研究将39个关于“反酸”(烧心/消化不良/胃食管反流病)的常见患者问题分别提交给ChatGPT-5、Gemini-2.5和Claude-4,由3名胃肠病学家就准确性、全面性、共情和可操作性评分,由20名患者就共情、全面性、可操作性、关怀和有用性评分,并分析可读性指数,结果显示模型间在医生评分的多个维度存在显著差异,Gemini-2.5和Claude-4在准确性、全面性和可操作性上高于ChatGPT-5,Claude-4共情得分最高,患者对各模型的可理解性评分普遍较高,但认为Gemini-2.5和Claude-4的回答比ChatGPT-5更具可操作性,ChatGPT-5的回答可读性最好(约相当