arXiv 2026年9月25日该工作提出 ClinCoT,一个临床感知的视觉思维链框架:用临床假设驱动区域生成(借助 MedKLIP 类工具产生疾病条件激活图并提取候选区域),让目标 Med-VLM 在原始图像与各候选区域联合条件下生成多条区域条件推理链,再由两个 Med-LLM 评估器按当前步得分与下一步影响加权、并以评估器一致性惩罚分歧,构造偏好对;训练采用带分数间隔的 margin-aware DPO 与迭代式偏好数据再生成,在 SLAKE、VQA-RAD 与 IU-Xray 上多数指标优于 DPO、Self-Rewarding、STLLaVA-Med、POVID、SIMA、FiSAO 与 MMedPO,其中报告生成任务最强,VQA-RAD 上低于 MM该工作提出 ClinCoT,一个临床感知的视觉思维链框架:用临床假设驱动区域生成(借助 MedKLIP 类工具产生疾病条件激活图并提取候选区域),让目标 Med-VLM 在原始图像与各候选区域联合条件下生成多条区域条件推理链,再由两个 Med-LLM 评估器按当前步得分与下一步影响加权、并以评估器一致性惩罚分歧,构造偏好对;训练采用带分数间隔的 margin-aware DPO 与迭代式偏好数据再生成,在 SLAKE、VQA-RAD 与 IU-Xray 上多数指标优于 DPO、Self-Rewarding、STLLaVA-Med、POVID、SIMA、FiSAO 与 MMedPO,其中报告生成任务最强,VQA-RAD 上低于 MMClinCoT 把偏好优化从答案层下沉到病灶区域推理:在 SLAKE、VQA-RAD、IU-Xray 上多数指标优于 MMedPO 等基线,SFT 初始化后提升更一致该工作提出 ClinCoT,一个临床感知的视觉思维链框架:用临床假设驱动区域生成(借助 MedKLIP 类工具产生疾病条件激活图并提取候选区域),让目标 Med-VLM 在原始图像与各候选区域联合条件下生成多条区域条件推理链,再由两个 Med-LLM 评估器按当前步得分与下一步影响加权、并以评估器一致性惩罚分歧,构造偏好对;训练采用带分数间隔的 margin-aware DPO 与迭代式偏好数据再生成,在 SLAKE、VQA-RAD 与 IU-Xray 上多数指标优于 DPO、Self-Rewarding、STLLaVA-Med、POVID、SIMA、FiSAO 与 MMedPO,其中报告生成任务最强,VQA-RAD 上低于 MM该工作提出 ClinCoT,一个临床感知的视觉思维链框架:用临床假设驱动区域生成(借助 MedKLIP 类工具产生疾病条件激活图并提取候选区域),让目标 Med-VLM 在原始图像与各候选区域联合条件下生成多条区域条件推理链,再由两个 Med-LLM 评估器按当前步得分与下一步影响加权、并以评估器一致性惩罚分歧,构造偏好对;训练采用带分数间隔的 margin-aware DPO 与迭代式偏好数据再生成,在 SLAKE、VQA-RAD 与 IU-Xray 上多数指标优于 DPO、Self-Rewarding、STLLaVA-Med、POVID、SIMA、FiSAO 与 MMedPO,其中报告生成任务最强,VQA-RAD 上低于 MM