跳到主要内容
返回时间线
arXiv来源发表:

ClinCoT 把偏好优化从答案层下沉到病灶区域推理:在 SLAKE、VQA-RAD、IU-Xray 上多数指标优于 MMedPO 等基线,SFT 初始化后提升更一致

核心概要

该工作提出 ClinCoT,一个临床感知的视觉思维链框架:用临床假设驱动区域生成(借助 MedKLIP 类工具产生疾病条件激活图并提取候选区域),让目标 Med-VLM 在原始图像与各候选区域联合条件下生成多条区域条件推理链,再由两个 Med-LLM 评估器按当前步得分与下一步影响加权、并以评估器一致性惩罚分歧,构造偏好对;训练采用带分数间隔的 margin-aware DPO 与迭代式偏好数据再生成,在 SLAKE、VQA-RAD 与 IU-Xray 上多数指标优于 DPO、Self-Rewarding、STLLaVA-Med、POVID、SIMA、FiSAO 与 MMedPO,其中报告生成任务最强,VQA-RAD 上低于 MM

AI-generated editorial illustration: ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models

深度剖析

提出自动化的临床假设驱动区域级偏好数据构建流程:给定医学图像与预定义临床假设集合,用临床感知视觉工具(如 MedKLIP)得到疾病条件激活图,经阈值化与连通域提取定位区域,再让目标模型在原始图像与每个候选区域联合条件下生成多条区域条件推理链。 既有医学对齐方法(如 MMedPO、自奖励、STLLaVA-Med、模态对齐目标)主要在响应层把整条回答当作整体做偏好优化,不显式建模局部病灶区域如何影响中间推理步骤;该工作把偏好数据下沉到区域条件推理链这一粒度。 论文给出完整方法描述与公式(区域生成、响应生成、评估、配对),并在三个基准上做实验;偏好数据可视化见图 2,覆盖 VQA-RAD、SLAKE、IU-Xray 的偏好/非偏好答案与分数示例。

提出共识加权评分与分数间隔感知的偏好优化:评估器同时给出当前步得分与对下一步响应质量的影响(以 γ 加权),两个 Med-LLM 评估器的分数按均值乘以评估器分歧的指数惩罚合并,训练损失在 DPO 对数比之差上再减去由偏好分数映射得到的间隔项。 标准 DPO 只用偏好排序、不含分数幅度信息;该工作把偏好分数差显式写入决策间隔,并用双评估器一致性抑制有争议的评分,从而在推理链之间做更细的区分。 消融显示去掉 γ(w/o γ)与改用单一评估器(single evaluator)均使各指标下降,其中报告生成任务下降更明显;论文据此说明下一步得分与共识评分对长程推理质量的作用。

采用迭代学习:把全部图像-问题集合划分为 m 个不相交子集,每轮用当前模型在对应子集上重新生成偏好数据并优化,共 m 轮得到最终模型。 标准 DPO 在静态偏好数据上优化,模型策略演化后可能出现分布不匹配;该工作让偏好数据随策略更新而再生成。 消融中“w/o iterative learning”(一次性生成全部偏好对、只训练一次)在 SLAKE、VQA-RAD、IU-Xray 各指标上均低于完整 ClinCoT。

在 SLAKE、VQA-RAD 两个医学 VQA 基准与 IU-Xray 报告生成基准上验证:以 LLaVA-Med-1.5 7B 为目标模型、LoRA 微调,ClinCoT 在报告生成上取得所比较基线中的最强结果,在 SLAKE 上优于 MMedPO,在 VQA-RAD 上低于 MMedPO;在 SFT 初始化设置下取得整体最佳表现。 相对 DPO、Self-Rewarding、STLLaVA-Med、POVID、SIMA、FiSAO 与医学专用 MMedPO 的系统对比,并额外在 SFT 前后两种训练范式下评估兼容性。 主结果表给出各数据集的开/闭式指标与 BLEU、ROUGE-L、METEOR,ClinCoT 结果带标准差(如 SLAKE Open 53.73±0.3、Closed 73.41±0.2;IU-Xray BLEU 24.96±0.2、METEOR 35.44±0.2;SFT 设置下 SLAKE Open 56.13±0.5、Closed 75.77±0.2、IU-Xray BLEU 26.17±0.2、METEOR 36.59±0.1)。

启示与展望

该结果面向使用医学视觉语言模型做医学 VQA 与放射报告生成的研究与工程场景:目标模型为 LLaVA-Med-1.5 7B,采用 LoRA 微调,推理链 T=3 步、每步 k=2 对、迭代 m=4 轮,评估器为 LLaMA3-Med42-7B 与 BioMistral-7B,评测集为 SLAKE、VQA-RAD、IU-Xray。它使区域级临床推理可以被嵌入偏好学习,为后续在更多影像模态、更多模型规模上复用该数据生成与优化流程提供了起点;论文也指出区域准确性仍有改进空间,可作为后续工作方向。

论文报告的是三个基准上的自动指标,未涉及临床读者研究或前瞻性验证,因此这些提升在真实临床工作流中的意义仍需进一步观察。VQA-RAD 上 ClinCoT 低于 MMedPO,作者解释为短答案场景下响应级临床加权仍有竞争力、而区域条件推理链在缺少任务适配时可能引入不稳定,这一解释本身提示区域条件推理的收益可能依赖任务形态与初始化方式。消融显示去掉 CoT、去掉分数间隔、去掉迭代学习、去掉下一步得分或改用单一评估器都会下降,说明性能对多个组件同时成立有依赖,各组件在更大模型或更多数据下的相对贡献仍是开放问题。此外,评估器本身是 Med-LLM,其评分作为监督信号的质量边界、以及区域提取工具(如 MedKLIP)的区域准确性对最终推理的影响,论文以“未来工作”方式提出,尚待进一步量化。

来源