arXiv 2026年9月25日该工作提出 ConRad,一个基于强化学习的框架,用 GRPO 算法和对数评分规则奖励微调医学大视觉语言模型,使其在生成放射报告的同时输出报告级或句子级的言语化置信度,在 MIMIC-CXR 上报告级 ECE 降至 0.106、句子级 ECE 降至 0.239,并在 IU-Xray 零样本迁移中把 ECE 从 0.310 改善到 0.034,同时报告生成质量(GREEN)保持稳定。该工作提出 ConRad,一个基于强化学习的框架,用 GRPO 算法和对数评分规则奖励微调医学大视觉语言模型,使其在生成放射报告的同时输出报告级或句子级的言语化置信度,在 MIMIC-CXR 上报告级 ECE 降至 0.106、句子级 ECE 降至 0.239,并在 IU-Xray 零样本迁移中把 ECE 从 0.310 改善到 0.034,同时报告生成质量(GREEN)保持稳定。ConRad 用 GRPO 与对数评分规则微调医学视觉语言模型,使报告级 ECE 从 0.642 降至 0.106,并在 IU-Xray 零样本迁移中把 ECE 从 0.310 改善到 0.034该工作提出 ConRad,一个基于强化学习的框架,用 GRPO 算法和对数评分规则奖励微调医学大视觉语言模型,使其在生成放射报告的同时输出报告级或句子级的言语化置信度,在 MIMIC-CXR 上报告级 ECE 降至 0.106、句子级 ECE 降至 0.239,并在 IU-Xray 零样本迁移中把 ECE 从 0.310 改善到 0.034,同时报告生成质量(GREEN)保持稳定。该工作提出 ConRad,一个基于强化学习的框架,用 GRPO 算法和对数评分规则奖励微调医学大视觉语言模型,使其在生成放射报告的同时输出报告级或句子级的言语化置信度,在 MIMIC-CXR 上报告级 ECE 降至 0.106、句子级 ECE 降至 0.239,并在 IU-Xray 零样本迁移中把 ECE 从 0.310 改善到 0.034,同时报告生成质量(GREEN)保持稳定。