先检索后验证:评估大语言模型生成医学信息的证据支持与幻觉
核心概要
该研究对 GPT-5、OpenAI o3-mini 和 GPT-3.5 三个大语言模型在 97 项随机对照试验的 RoB 2 偏倚风险评估任务上进行评测,先用 Okapi BM25 从试验报告中检索相关段落,再对每条生成声明给出支持、矛盾、未找到或超出范围的证据判定并附原文引文,结果显示各模型二分类准确率高达 90%-98%,但证据支持率仅为 60%-65%,保守幻觉率为 34%-37%,说明决策层面的高准确率并不等于输出有文献依据。
深度剖析
提出并实施了一套“先检索后验证”的证据核查流程,用 Okapi BM25 检索试验报告段落,再对每条模型生成的 RoB 2 声明给出支持、矛盾、未找到或超出范围的判定并附逐字引文。 以往评测多依赖与人类判断的一致性,该研究直接把生成内容与源文献对照,量化证据支持率与幻觉率。 在全部 97 项具备完整人类 RoB 2 标注且全文可获取的随机对照试验上运行,构成完整参考集,未做训练-验证划分。
AI 生成的偏倚风险判断在二分类准确率上表现很高(各领域 90%-98%),但精确准确率明显偏低(42%-71%),说明方向性判断正确时严重程度分级仍常出现分歧。 同时报告精确准确率与二分类准确率,揭示一致性指标掩盖的分级差异。 使用精确准确率、二分类准确率、敏感度、特异度、F1、Youden J 以及 Cohen κ 和 Fleiss κ 等多类指标评测。
GPT-5 整体表现最强,总体偏倚风险结论的二分类准确率达到完美,与人类评审的一致性最高(二次 κ 最高 0.81),平均证据支持率最高(64.3%),严格幻觉率最低(35.7%)。 在三个模型中给出相对排序,并同时呈现其决策表现与证据支持表现。 基于同一 97 项试验参考集与统一的结构化 RoB 2 输出约束。
各模型平均 top-1 BM25 检索得分相近(约 30-31),提示幻觉差异并非主要来自检索强度差异。 把检索质量与幻觉差异区分开,说明问题更可能出在生成环节而非检索环节。 对三个模型使用同一检索算法与同一参考集,检索得分可直接比较。
启示与展望
该研究面向使用大语言模型进行证据合成、指南制定与临床知识管理的数字健康从业者与医学信息学研究者,适用于需要输出可追溯、可审计的医学证据评估场景;其流程以结构化 RoB 2 信号问题与领域判断为输出约束,并以可获取全文的随机对照试验报告为验证对象。
读者仍可关注:该流程在非结构化输出、其他证据评估工具或非随机对照试验文献上的表现如何;检索算法与验证判定规则变化时结果是否稳定;以及证据支持率与幻觉率在不同任务与模型版本间的可比性。本次加载文本为摘要性内容,未包含图表与完整方法细节,因此对具体判定规则与逐领域结果的了解仍有限。
