跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

medRxiv

大语言模型真的在使用临床病例描述吗?一项针对骨科住院医师培训考试的问题消融研究

该研究对2020至2024年共792道骨科住院医师培训考试(OITE)题目(其中434道含临床图像、358道不含图像)进行问题成分消融,评估三个开源Ministral-3模型(3B、8B、14B)与五个专有模型(Claude Haiku-4.5、Sonnet-4.6、Opus-4.8、GPT-5.6 Luna、GPT-5.6 Terra),发现含图像题在完整信息下汇总准确率为59.13%(58.21-60.08),去掉图像后仍为59.13%(58.18-60.11),而去掉临床病例描述后降至49.05%(48.07-50.00);不含图像题从完整临床背景的72.94%(72.10-73.85)降至去