用定制提示策略与混合方法评估大语言模型生成放射报告通俗摘要的能力
核心概要
该研究以BioNLP 2023报告摘要数据集中的100份放射报告为输入,让五个大语言模型在各自经预试验选定的提示风格下(GPT-4用少样本、GPT-4o mini与Gemini 1.5 Pro/Flash用生成知识、Llama 3.1用零样本)生成面向患者的通俗摘要,再由两名放射科专科培训医师、两个大型推理模型(Gemini 2.5 Pro与GPT-oss-120b)以及可读性指标进行混合评估,结果显示Gemini 1.5 Flash与Pro配合生成知识提示在可操作性、最少监督可用性和可读性上排名最高,GPT-4少样本在人类评分者眼中准确率最高(98%),且人类专家与大型推理模型的评分高度一致。
深度剖析
在人类专家与大型推理模型的合并百分比一致性排名中,Gemini 1.5 Flash(生成知识)位列第一,Gemini 1.5 Pro(生成知识)紧随其后,GPT-4o mini(生成知识)与GPT-4(少样本)并列第三,Llama 3.1(零样本)在所有标准中均排最后。 既有文献多只比较模型本身或只比较提示本身,且多采用零样本;本研究把“模型+定制提示”作为一个真实世界使用单元来排序,并首次为每个模型单独选定提示风格。 基于100份报告、5个模型共500份摘要,由2名人类评分者与2个大型推理模型按5点Likert量表评分,并用Friedman检验与事后Nemenyi检验评估差异显著性(如Rater 1 P < 4.97 × 10⁻²,Rater 2 P < 9.03 × 10⁻²¹)。
在“无需监督即可交给患者”这一标准上,Gemini 1.5 Pro(生成知识)获得最高一致性(人类评分者71%,人类与大型推理模型合并61%),Gemini 1.5 Flash(生成知识)紧随其后(70%与60%),其他模型组合均低于30%。 该标准把评估从“文本质量”推进到“能否直接进入临床沟通流程”,为工作流层面的可用性提供了量化参照。 来自两名有7年和8年经验的放射科专科培训医师的盲法评分,以及两个大型推理模型的同标准评分,样本为500份摘要。
可读性方面,Gemini 1.5 Pro(生成知识)产出最易读的摘要(Flesch Reading Ease 67.84,Flesch-Kincaid Grade Level 7.55),而GPT-4o mini(生成知识)最差(FRE 53.69,FKGL 10.77);所有模型相对原始报告(12年级以上阅读水平)都显著简化。 研究把主观评分与客观可读性指标并列呈现,显示主观排名与可读性排名并不完全重合,例如GPT-4少样本在人类准确率上最高但摘要最长。 使用FRE、FKGL、SMOG、ARI、Dale-Chall五种指标,Friedman检验显示模型间差异显著(P < 2.36 × 10⁻³³)。
人类专家与大型推理模型评分高度一致,Gemini 2.5 Pro(LRM 1)与人类评分者的完全分歧仅0.96%,GPT-oss-120b(LRM 2)为3.4%;且GPT-oss-120b并未偏好自家GPT系列摘要。 这是首次在放射报告通俗摘要任务中把大型推理模型作为评估者,并与人类专家做一致性对照,为可扩展的第二轮审阅提供了初步证据。 基于2500条Likert响应的混淆矩阵与一致性统计,两个大型推理模型来自不同厂商以降低自我偏好偏差。
启示与展望
该研究面向放射报告通俗摘要的生成与评估方法,适用于希望把大语言模型接入患者沟通流程的研究者与临床团队,其提示模板、混合评估框架与预试验设计可复用于其他模型版本与临床文本场景;结果被明确界定为特定模型版本的“时间切片”评估,而非性能基准。
读者仍需关注:人类评分者间一致性处于低至中等水平,且一名评分者更常选择“中立”;样本量较小,可能未覆盖罕见病变与超长报告;可读性指标只反映句法与音节复杂度,未直接测量患者真实理解;评分标准未直接评估有害信息,被标记为“不准确”的内容是否具有危险性尚不清楚;大型推理模型评估者可能共享模型偏差,需在更大队列上做外部验证;单次生成也意味着措辞与可读性在重复生成时可能波动。
