跳到主要内容
返回时间线
Journal of medical Internet research来源发表:

大语言模型在肝胆胰肿瘤多学科决策中的稳定性与一致性:回顾性比较可行性研究

核心概要

这项回顾性研究将107例单中心肝胆胰肿瘤多学科团队(MDT)会议病例的标准化摘要重复4次提交给GPT-4o、GPT-5.2、Gemini 3 Pro和Claude Sonnet 4.5四个大语言模型,发现模型间回答稳定性差异显著(Gemini 3 Pro不一致率最低,均值12.8%,Fleiss κ=0.737;GPT-4o最高,均值30.2%,Fleiss κ=0.430),与MDT决策的一致率在初始回答下为48.6%–72.9%、在众数回答下为66.3%–74.5%,且手术类F1分数(0.400–0.520)持续低于化疗类(0.621–0.836),提示仅用一致性不足以评估大语言模型作为临床决策支持工具。

AI-generated editorial illustration: Large Language Models in Multidisciplinary Decision-Making for Hepatopancreatobiliary Oncology: Retrospective Comparative Feasibility Study.

深度剖析

研究首次系统量化了同一临床输入下大语言模型治疗建议的重复稳定性,发现模型间差异显著(P=.01)。 以往对大语言模型临床决策支持的评估多聚焦于与专家决策的一致性,而很少检验同一输入是否得到同一答案;本研究通过4次独立会话重复查询,引入不一致率、平均两两一致度和Fleiss κ等不依赖单一参考回答的稳定性指标。 基于107例连续MDT病例、4个模型、每例4次重复查询,稳定性差异具有统计学意义(P=.01),并报告了各模型不一致率的均值与标准差。

大语言模型与MDT决策的一致率处于中等水平,且随评估定义(初始回答与众数回答)而变化,表现最好的模型在两种定义下并不相同。 研究同时报告初始回答与众数回答两种口径下的一致性,并配合Cohen κ与分类别F1分数,说明单一一致性数字会掩盖模型间的相对排序变化。 一致率区间为初始回答48.6%–72.9%、众数回答66.3%–74.5%,并给出分类别F1分数:手术0.400–0.520,化疗0.621–0.836。

完全不一致(4次回答彼此不同)出现在17/107例(15.9%),且在31例解剖学不可切除病例中一例也未出现(Fisher精确检验,P=.003)。 研究进一步定位了不稳定性集中出现的临床情境,而非仅报告总体稳定性数字。 基于107例样本的Fisher精确检验(P=.003),并报告了完全不一致的例数与比例。

复发或治疗中疾病(校正OR 5.40,95% CI 1.65–17.68;P=.005)、胰腺肿瘤位置(校正OR 7.37,95% CI 2.03–26.78;P=.002)和低MDT一致度(校正OR 10.33,95% CI 1.54–69.38;P=.016)与完全不一致独立相关。 研究给出了与模型回答不稳定相关的病例层面因素,为后续在何种情境下需要额外人工复核提供了线索。 多变量校正后的比值比及95%置信区间,均达到统计学显著。

启示与展望

本研究界定的适用范围是单中心肝胆胰肿瘤MDT会议场景:2024年9月1日至2025年8月31日期间连续讨论的107例病例,通过消费级网页界面提交标准化病例摘要,模型为GPT-4o、GPT-5.2、Gemini 3 Pro和Claude Sonnet 4.5,每例重复4次。在此设定下,结果支持将大语言模型视为MDT式决策环境中的推理支持层,而非替代MDT决策;对希望评估模型稳定性的研究者与希望引入此类工具的临床团队,本研究提供了可复用的稳定性量化思路(不一致率、平均两两一致度、Fleiss κ)以及需要重点复核的病例特征线索。

读者仍会关注:稳定性指标在更多重复次数或不同会话设置下是否保持同样排序;众数回答口径下一致率提升意味着什么;手术类F1分数持续偏低反映的是模型对手术指征的把握还是MDT选项本身的界定;以及完全不一致与复发或治疗中疾病、胰腺肿瘤位置、低MDT一致度之间的关联在更大样本与多中心环境中是否稳定。此外,本次可获取的文本为摘要性内容,缺少图表与补充材料,因此无法进一步核对各模型逐例回答分布、置信区间细节与敏感性分析,这些属于后续阅读原文时需要留意的开放问题。

来源