大语言模型真的在使用临床病例描述吗?一项针对骨科住院医师培训考试的问题消融研究
核心概要
该研究对2020至2024年共792道骨科住院医师培训考试(OITE)题目(其中434道含临床图像、358道不含图像)进行问题成分消融,评估三个开源Ministral-3模型(3B、8B、14B)与五个专有模型(Claude Haiku-4.5、Sonnet-4.6、Opus-4.8、GPT-5.6 Luna、GPT-5.6 Terra),发现含图像题在完整信息下汇总准确率为59.13%(58.21-60.08),去掉图像后仍为59.13%(58.18-60.11),而去掉临床病例描述后降至49.05%(48.07-50.00);不含图像题从完整临床背景的72.94%(72.10-73.85)降至去
深度剖析
临床病例描述是提升大语言模型在OITE上表现的主要信息成分,而图像的作用很小。 以往研究多以考试总准确率衡量模型能力,该研究通过逐项移除问题成分,把整体分数拆解为各成分的贡献,从而区分病例描述、图像与选项各自的作用。 基于792道OITE题目、八个模型、含图像题五种与不含图像题三种消融条件,采用中位数与IQR汇总并以Holm校正的配对分析比较;含图像题去掉图像后准确率几乎不变(59.13%对59.13%),去掉病例描述后明显下降(至49.05%)。
仅给出答案选项、不给题干、临床背景或图像时,所有模型的准确率仍高于25%的随机水平。 这一条件把问题信息压缩到只剩选项,直接检验模型在缺乏临床内容时是否仍能作答,而非仅报告完整信息下的分数。 含图像题最高为Claude Opus 4.8的45.62%(44.24-47.24),不含图像题最高为GPT-5.6 Terra的46.09%(44.41-47.77),且每个模型均超过25%的随机期望;作者据此提示模型可能在学习虚假相关。
BioMedBERT语义相似度在各模型间保持较高水平,却与准确率无显著关联,也不能稳定区分正确与错误回答。 该研究把解释文本的语义相似度与答题准确率并列考察,说明解释流畅度与答题正确性可能并不同步。 以BioMedBERT评估模型生成解释与参考讨论的语义相似度,Spearman相关为ρ=-0.17、P=0.29,未达显著;尽管各模型准确率差异很大,相似度仍保持较高。
专有模型准确率明显高于开源模型,但两者在仅给选项时都高于随机水平。 该研究在同一消融框架下同时纳入三个开源Ministral-3模型与五个专有模型,使跨模型比较建立在相同题目与相同条件之上。 GPT-5.6 Terra在含图像题(81.80%,80.41-82.95)与不含图像题(94.13%,93.30-94.97)中均取得最高完整信息准确率,而所有模型在仅给选项条件下仍高于随机。
启示与展望
该研究界定了其结论的适用范围:评估对象为2020至2024年的792道OITE题目(434道含图像、358道不含图像)以及三个开源Ministral-3模型与五个专有模型,消融条件为含图像题五种、不含图像题三种。在这一设定下,结果可用于理解骨科培训考试类题目中各成分的相对贡献,并为后续在更广专科、更多题型或更多模型版本上重复类似消融提供起点。
读者仍可关注:仅选项条件下高于随机的表现,其来源是选项本身的线索、训练数据中的题目记忆,还是其他机制,原文未作区分;BioMedBERT相似度高但相关性不显著,解释质量与正确性之间的关系仍需进一步刻画;此外,本次读取为摘要层面的文本,未包含图表与补充材料,若其中含有按模型或按年份的细分结果,可能影响对各成分贡献的细致理解。
