ConRad 用 GRPO 与对数评分规则微调医学视觉语言模型,使报告级 ECE 从 0.642 降至 0.106,并在 IU-Xray 零样本迁移中把 ECE 从 0.310 改善到 0.034
核心概要
该工作提出 ConRad,一个基于强化学习的框架,用 GRPO 算法和对数评分规则奖励微调医学大视觉语言模型,使其在生成放射报告的同时输出报告级或句子级的言语化置信度,在 MIMIC-CXR 上报告级 ECE 降至 0.106、句子级 ECE 降至 0.239,并在 IU-Xray 零样本迁移中把 ECE 从 0.310 改善到 0.034,同时报告生成质量(GREEN)保持稳定。
深度剖析
ConRad 把基于评分规则的置信度校准从纯文本大语言模型扩展到多模态长文本放射报告生成,让模型在输出报告文本的同时给出言语化置信度。 此前放射报告中的不确定性研究多是把放射科医生的不确定性措辞当作语言风格来复现,或依赖多次采样、语义一致性、事后审计来估计不确定性;ConRad 直接训练模型自身的内部置信度校准,并支持报告级与句子级两种粒度。 论文在 MIMIC-CXR 上以 medgemma-4b-it 为基座、仅用 LoRA 微调语言模型部分,报告级训练 3000 样本一个 epoch、句子级 1500 样本一个 epoch,并与 Verbalize Base、Verbalize Supervised、Sequence Probability、P(True)、Self-Consistency、Trained Probe 等基线对比。
报告级置信度校准显著改善:ConRad 的 ECE 为 0.106,低于 Trained Probe 的 0.121、Verbalize Supervised 的 0.206 和 Verbalize Base 的 0.642,同时取得最高的 Pearson 相关 0.431。 论文称相对基座模型 ECE 降低超过 80%,校准曲线更接近理想对角线,置信度分布从基座模型的极端过度自信转向更均衡;而 GREEN 分数保持在 0.252,与 Verbalize Base 的 0.257 接近,说明校准训练没有改变报告生成质量。 表 1 给出 95% 置信区间,例如 ConRad 的 ECE 为 0.106 [0.093, 0.118],Verbalize Base 为 0.642 [0.630, 0.654];GREEN 作为控制指标用于验证报告质量稳定。
句子级置信度同样得到改善:ConRad 的 ECE 为 0.239,AUROC 为 0.633,优于 Verbalize Base 的 0.438 与 0.558,以及 Verbalize Supervised 的 0.446 与 0.552。 论文报告句子级 ECE 相对基座模型降低约 40%,并指出在二值正确性目标下,RL 公式仍能学到细粒度置信度,而监督微调只能复现二值目标;同时论文说明句子级校准整体仍比报告级更具挑战。 表 2 给出 95% 置信区间,例如 ConRad 的 ECE 为 0.239 [0.225, 0.253]、AUROC 为 0.633 [0.620, 0.647];GREEN 在训练后保持稳定(0.262)。
按置信度过滤句子可提升事实精度,但会牺牲完整性,因此论文主张把低置信句子标记给人工复核而非自动删除。 表 3 显示 Precision GREEN 随阈值单调上升:ConRad 从全部句子的 0.421 升到置信度等于 10 时的 0.642,但剩余句子数从 6317 降到 53,标准 GREEN 从 0.262 降到 0.097;相比之下 Verbalize Base 过滤只带来边际精度提升(0.425 到 0.447)。 该结论基于 MIMIC-CXR 上按预测置信度过滤后的句子级 Precision GREEN 统计,论文同时报告了精度与完整性之间的权衡。
启示与展望
该工作面向使用胸部 X 光与 MIMIC-CXR 风格报告生成的临床 AI 辅助场景,训练与评估以 medgemma-4b-it 为基座、仅微调语言模型部分,置信度以 0 到 10 的整数表达并归一化到 [0,1]。它使报告级分诊和句子级定向复核成为可能:报告级分数可用于优先安排人工复核,句子级分数可用于标记需要重点查看的表述。论文还展示了在 IU-Xray 上的严格零样本迁移,以及 50 份报告、3 位评分者的小规模临床评估,说明校准增益可迁移到专家判断。
句子级校准仍比报告级更具挑战,论文也指出句子级结果整体弱于报告级。置信度训练依赖 GREEN 这一自动报告质量指标作为正确性信号,因此校准质量与该指标的可靠性相关。临床评估规模较小(50 份报告、3 位评分者),其结论应视为初步信号而非广泛临床验证。按置信度过滤会带来精度与完整性的权衡,论文建议标记而非删除低置信内容,但如何在真实工作流中设定阈值、以及标记后复核成本如何变化,仍是开放问题。此外,方法目前绑定胸部 X 光报告与特定基座模型,向其他影像模态、其他语言和更大规模部署的迁移仍需进一步研究。
