跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

PLOS digital health

用定制提示策略与混合方法评估大语言模型生成放射报告通俗摘要的能力

该研究以BioNLP 2023报告摘要数据集中的100份放射报告为输入,让五个大语言模型在各自经预试验选定的提示风格下(GPT-4用少样本、GPT-4o mini与Gemini 1.5 Pro/Flash用生成知识、Llama 3.1用零样本)生成面向患者的通俗摘要,再由两名放射科专科培训医师、两个大型推理模型(Gemini 2.5 Pro与GPT-oss-120b)以及可读性指标进行混合评估,结果显示Gemini 1.5 Flash与Pro配合生成知识提示在可操作性、最少监督可用性和可读性上排名最高,GPT-4少样本在人类评分者眼中准确率最高(98%),且人类专家与大型推理模型的评分高度一致。