Journal of medical Internet research 这项回顾性研究将107例单中心肝胆胰肿瘤多学科团队(MDT)会议病例的标准化摘要重复4次提交给GPT-4o、GPT-5.2、Gemini 3 Pro和Claude Sonnet 4.5四个大语言模型,发现模型间回答稳定性差异显著(Gemini 3 Pro不一致率最低,均值12.8%,Fleiss κ=0.737;GPT-4o最高,均值30.2%,Fleiss κ=0.430),与MDT决策的一致率在初始回答下为48.6%–72.9%、在众数回答下为66.3%–74.5%,且手术类F1分数(0.400–0.520)持续低于化疗类(0.621–0.836),提示仅用一致性不足以评估大语言模型作为临床决策支持工具。