跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

Journal of medical Internet research

大语言模型在肝胆胰肿瘤多学科决策中的稳定性与一致性:回顾性比较可行性研究

这项回顾性研究将107例单中心肝胆胰肿瘤多学科团队(MDT)会议病例的标准化摘要重复4次提交给GPT-4o、GPT-5.2、Gemini 3 Pro和Claude Sonnet 4.5四个大语言模型,发现模型间回答稳定性差异显著(Gemini 3 Pro不一致率最低,均值12.8%,Fleiss κ=0.737;GPT-4o最高,均值30.2%,Fleiss κ=0.430),与MDT决策的一致率在初始回答下为48.6%–72.9%、在众数回答下为66.3%–74.5%,且手术类F1分数(0.400–0.520)持续低于化疗类(0.621–0.836),提示仅用一致性不足以评估大语言模型作为临床决策支持工具。