跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

JMIR AI

先检索后验证:评估大语言模型生成医学信息的证据支持与幻觉

该研究对 GPT-5、OpenAI o3-mini 和 GPT-3.5 三个大语言模型在 97 项随机对照试验的 RoB 2 偏倚风险评估任务上进行评测,先用 Okapi BM25 从试验报告中检索相关段落,再对每条生成声明给出支持、矛盾、未找到或超出范围的证据判定并附原文引文,结果显示各模型二分类准确率高达 90%-98%,但证据支持率仅为 60%-65%,保守幻觉率为 34%-37%,说明决策层面的高准确率并不等于输出有文献依据。