CARing 用组合式医学语义 ID 与覆盖奖励,在 MIMIC-III/IV 下次就诊诊断预测中取得最高召回(R@30 46.04%/46.52%)
核心概要
该工作提出 CARing,用残差量化把疾病名称与 ICD 本体路径压缩为组合式医学语义 ID(SID),经六项对齐任务、教师模型生成的语义增强语料与推理激活训练,使单个自回归模型能先推理再生成诊断 SID,并用覆盖奖励与多正例监督优化多标签覆盖;在 MIMIC-III 与 MIMIC-IV 上,其加权指标超过所有基于 EHR 训练的基线,并在每个报告的截断点取得最高召回,推理模式 R@30 分别为 46.04% 与 46.52%。
Figure 1: Motivation for multi-label reinforcement learning in next-visit diagnosis prediction. Standard RL can collapse onto one correct diagnosis, leaving others uncovered. Our coverage reward discounts repeated predictions and encourages coverage of distinct correct diagnoses.
arXiv深度剖析
把疾病表示为组合式医学 SID,使一个自回归 LLM 能在同一接口中读取纵向病史、用自然语言推理并生成诊断。 此前的医学 tokenizer(如 MedTok、MedRQ)把学到的离散表示主要作为下游预测器的输入,MERA 则为每个疾病分配一个原子 token,词表随诊断数量线性增长且自然语言推理不在其预测路径内;CARing 让疾病由共享码本 token 组合而成,并把推理与 SID 生成放在同一模型内。 方法层面给出残差量化构造、六项对齐任务(T1–T6)与推理激活流程;附录 C.4 报告名称加 ICD 路径变体的首 token 语义纯度提升(顶层 ICD 加权纯度 69.36%→90.51%,CCS 47.63%→69.78%),表 2 报告 R@30 由 38.97 升至 39.73。
覆盖奖励把每个正确预测的信用除以其在采样组内的出现频次,使组奖励等于不同正确诊断的数量,从而抑制重复命中、鼓励覆盖互补诊断。 常见 RLVR 只按单条轨迹最终答案是否正确给奖励,无法区分“重复同一正确诊断”与“覆盖不同正确诊断”;该奖励把频次调整直接解释为诊断覆盖,并给出组奖励等于不同正确预测数的性质证明。 附录 B.4 给出该性质的推导;消融中 EM 奖励(S5)为 18.88 w- 与 34.67 R@30,仅替换为覆盖奖励(S6)后升至 25.41 与 40.27,分别提高 6.53 与 5.60 分,并超过推理激活检查点 S4(23.57 w-、39.47 R@30)。
多正例监督在答案层为采样未覆盖到的正确诊断提供学习信号,与覆盖奖励互补。 覆盖奖励只能在采样出现正确 SID 后区分其价值,对未被采样到的正确诊断没有策略梯度信号;该辅助损失只监督 SID 答案 token,按固定枚举轮转分配目标正例。 在 S6 基础上加入多正例损失(S7)后,w- 与 R@30 升至 27.58 与 46.04,较 S6 提高 2.17 与 5.77 分;训练监测显示第 60 步每组唯一 SID 由 7.02 增至 12.40,批次级 SID 熵 4.58→5.58,正确预测的平均逆频率 0.32→0.60。
同一框架支持直接约束解码与多链推理加倒数排名融合两种推理设置,且两者都把预测限制在有效医学 SID 目录内。 直接模式不生成理由链,仅以纵向 SID 病史为条件做目录约束束搜索;推理模式采样多条推理链,每条链后做约束解码,再用 RRF 融合排名。 表 1 中推理模式在八个召回截断点中的七个领先,直接模式在 MIMIC-III R@40 高 0.09 分;推理模式相对直接模式在 MIMIC-III 与 MIMIC-IV 的 w- 分别高 2.49 与 2.04 分。
启示与展望
该结果面向以结构化诊断序列为输入的回顾性下次就诊诊断预测:在 MIMIC-III 与 MIMIC-IV 上,按患者划分 7:1:2 的训练/验证/测试集,MIMIC-IV 使用 10,000 名抽样患者队列,评价指标为加权分数与 top-k 召回。作者设想的应用场景是临床复核:候选诊断与推理模式的可读推理链可帮助医生回顾既往就诊、考虑值得进一步评估的疾病,而临床决策仍依赖检查、检验与专业判断,并需要前瞻性研究考察这种辅助如何改变病例复核与诊断决策。方法层面,SID 由概念描述与本体路径构造,因此该流程可迁移到其他编码体系;把药物、操作与检验事件加入病史,可让预测使用更完整的记录,并支持药物推荐等更广的 EHR 事件推荐任务。
推理链的临床含义仍需单独研究:作者指出看似合理的思维链可能遗漏影响预测的因素,其忠实性会随模型与任务变化;教师模型在构造训练轨迹时能看到参考诊断,而学生模型在推理时只能看到病史,两类轨迹的临床准确性以及与目标引导相关的伪影值得进一步考察。作者提出的后续分析包括:固定检查点、SID 病史与答案格式,比较有无推理链时各有效 SID 的对数分数与排名变化,统计采样链使多少额外目标诊断进入 top-k 候选,并在匹配采样数与计算量的条件下比较直接与推理推断,以量化轨迹条件、重复采样与排名融合各自的贡献。此外,覆盖奖励的性质分析指出,有限采样与优势归一化并不保证策略在所有真实诊断上全局均匀,这一点在解读覆盖增益时值得留意。
