ΔRepresentation 用反事实推理把病灶表型建模为相对正常解剖的表征增量,在六个医学 VLM 上同时提升病灶定位与表型识别
核心概要
该工作提出 ΔRepresentation,一个面向医学视觉语言模型的视觉表型表征学习框架:BaseAnatomy 用理想空间分布对正常解剖表征施加几何监督,Phenotype 通过反事实推理估计病灶块对应的正常解剖参考并学习表型特异的表征增量,使同一表型的增量在表征空间中聚集。在 ReXGroundingCT 与 LIDC-IDRI 上,该方法在六个预训练医学 VLM 上一致提升病灶定位与表型识别准确率。
Figure 1: BaseAnatomy structures the anatomical visual representation space, while Δ \Delta Phenotype organizes lesion-specific increments relative to counterfactual normal anatomy.
arXiv深度剖析
把病理表型定义为相对于其下方正常解剖的视觉变化,并在视觉表征空间中直接构造这一增量,而不是依赖文本语义对齐。 此前的细粒度对齐方法(如 TRRG、PRIOR、MedKLIP、MCA-RG、RadAlign)用报告句子或病理概念作为语义监督,文本语义描述表型的存在与亚类,但不显式表示相对于正常解剖的表型变化;该工作改为在视觉空间中用病灶块与其正常对应块的差来定义表型。 论文以方法论证与实验共同支撑:在 ReXGroundingCT 与 LIDC-IDRI 上,六个骨干(RadFM、LLaVA-Med、Lingshu、Hulu-Med、MedGemma、MedGemma1.5)的 VQA 平均绝对提升为定位 31.20%、表型 33.51%,RRG 平均绝对提升为定位 20.80%、表型 28.57%。
BaseAnatomy 用标注定义的理想空间分布提供几何监督,同时保留结构间几何关系与结构内空间连续性,从而建立稳定的正常解剖参考空间。 与依赖文本来源解剖语义的对齐不同,该模块直接用解剖标注与归一化 CT 坐标构造目标距离,并用成对余弦距离匹配的 smooth-L1 目标优化,辅以旋转与尺度变换的一致性和解剖类别均衡采样。 高维诊断显示旋转、缩放、平移下的 Pearson 相关分别为 0.9742、0.9751、0.9750;t-SNE 中训练后不同解剖结构的块形成更一致的簇,且块表征随三个 CT 空间轴的位置渐变;下采样后单块表征落在原 16 块表征分布中心附近。
Phenotype 通过反事实推理构造病灶块的正常参考并学习表型特异增量,随病灶样本增加持续细化表型簇。 增量由解剖匹配的 mask-negative 邻居以归一化反距离加权估计(8–48 个邻居、网格半径 4–10),同一表型的增量被鼓励一致、不同表型被分离,并配合定位监督、解剖保持与无病灶抑制。 推断的反事实嵌入与真实正常表征余弦距离仅 0.003 与 0.005(两个代表性案例);正常环紧致度 0.9882,异常到正常参考的平均/中位余弦距离 0.0233/0.0210;表型增量余弦轮廓系数 0.3607、最近原型准确率 75.46%。
表型表征随病灶阳性训练数据从 1% 增至 100% 而持续改善,说明增量学习可渐进细化而非一次性固定。 该工作把表型学习设计为可持续纳入新病灶样本的过程,同时保持正常解剖参考空间冻结,从而在不同解剖语境下逐步提升对病理视觉变化的编码与区分。 表型准确率随数据规模上升:ReXGroundingCT VQA 由 25.80 升至 43.11、RRG 由 15.55 升至 52.65;LIDC-IDRI 由 54.55 升至 77.69、RRG 由 50.41 升至 75.21;t-SNE 中四个表型随样本增加形成更紧凑可分的簇。
启示与展望
该框架面向以胸部 CT 轴位切片为分析单元的放射学解读场景,训练期需要解剖标注与病灶掩码来构造几何监督和反事实正常参考,推理期只输入未标注 CT 切片、切片位置信息与文本提示。它适用于希望在不更换语言骨干的前提下改进视觉编码器的研究者与工程团队,尤其是需要病灶定位与表型识别同时提升的 VQA 与报告生成流程。由于表型增量依赖 BaseAnatomy 提供的稳定正常参考空间,其收益在具备可靠解剖标注的解剖区域最为直接。
读者仍需关注:反事实正常参考由邻近 mask-negative 块估计,其可靠性在解剖结构边界或病灶范围较大时如何变化,文中未展开;表型增量的分离度以余弦轮廓系数 0.3607 与最近原型准确率 75.46% 衡量,属于中等水平,不同表型间的残余混淆程度值得进一步观察;空间池化后余弦轮廓与自质心余弦略有下降,说明表征对空间聚合并非严格不变,这一效应在下游对齐中的实际影响仍需更多分析;评估限于胸部 CT 的四种肺部表型与两个数据集,跨模态与跨解剖部位的泛化仍是开放问题。
