大语言模型回答胰腺癌问题的临床质量评估
核心概要
该研究让八个大语言模型(ChatGPT-5.5 Instant、Claude Sonnet 4.6、Gemini 3 Flash、Grok 4.20、Microsoft Copilot、Doubao Seed 1.8、DeepSeek-V4、Qwen 3.6)在连续三天回答十个面向患者的胰腺癌问题,由五名对平台身份设盲的评估者对全部240条回答按六个临床质量维度打分(共1200条评分),发现各平台总体表现存在差异,Grok 4.20与DeepSeek-V4平均分最高、Doubao Seed 1.8最低,差异在可操作性与具体性上最明显,相邻日分数波动以Doubao Seed 1.8和Qwen 3.6最突出,但经多重检验校正后没
深度剖析
研究以十个面向患者的胰腺癌问题、连续三天提交、八个平台、五名设盲评估者、六个临床质量维度、240条回答与1200条评分的规模,对模型回答的临床质量进行了系统评分。 相较以往多聚焦单一平台或单次提问的评估,这里把多平台、多日重复与设盲多维度评分结合起来,使平台间比较与短期一致性观察可以在同一框架内进行。 证据来自240条回答与1200条评分的结构化评分数据,评估者对平台身份设盲,并覆盖六个临床质量维度。
各平台总体表现存在差异,Grok 4.20与DeepSeek-V4平均分最高,Doubao Seed 1.8最低,且差异在可操作性与具体性两个维度上最为明显。 这为“不同模型在患者向癌症问答上的临床质量并不等同”提供了同一问题集下的横向比较结果,并把差异定位到可操作性与具体性这类与患者实际决策更相关的维度。 结论基于同一组十个问题在八个平台上的评分比较,差异幅度以平均分与维度间对比呈现。
相邻日分数波动在Doubao Seed 1.8与Qwen 3.6上最明显,但在多重检验校正后没有平台表现出显著的日期系统性效应。 该结果把“短期一致性”作为独立观察对象,同时提示逐日波动与系统性日期效应是两件需要区分的事。 证据来自连续三天重复提交所得到的相邻日分数变化,并经过多重检验校正后判断无显著系统性日期效应。
被评估平台总体上提供了相关信息,但临床有用性与可重复性存在差异,因此模型生成的胰腺癌信息应补充而非替代专业临床沟通。 研究把评估落点从“信息是否相关”推进到“临床是否有用、是否可重复”,并据此给出面向患者使用的定位建议。 该判断建立在六个临床质量维度的评分结果与三天重复观察之上,属于对评估范围内表现的总结性结论。
启示与展望
该研究适用于患者向胰腺癌问答这一具体场景,覆盖八个具名平台、十个问题、连续三天与六个临床质量维度,因此其结论最直接服务于希望了解模型回答临床质量与短期一致性的患者、临床沟通者与评估设计者;若要用于其他癌种、其他语言或其他提问方式,需要另行验证。
读者仍会关注:十个问题与三天观察窗口能否代表更广泛的患者提问与更长时间的使用;六个临床质量维度的具体构成与评分细则如何影响平台间差异;相邻日波动与无显著系统性日期效应并存时,应如何理解短期一致性;以及不同平台版本更新后结论是否仍然成立。由于本次读取的文本为不完整范围,若图表或补充材料中包含维度细节与统计结果,相关判断仍需以原文为准。
