SentZero 用抽象句映射与假阴性补丁级对齐,在 MIMIC-CXR 预训练后零样本胸部 X 光分类与定位上超过此前多任务方法
核心概要
SentZero 是一个以句子为中心的胸部 X 光视觉-语言预训练框架:它用大语言模型把放射报告中的短语抽取并映射为“主题-存在性”的抽象句以扩充正样本对,用一项辅助损失把最相似的图像补丁拉向跨研究重复出现的临床句子以缓解假阴性,并对视觉嵌入施加句子条件化的残差调制;在 MIMIC-CXR 上预训练后,它在 Open-I、ChestXray14、PadChest、ChestXDet10、CheXpert 的零样本多标签分类和 ChestXDet10、MS-CXR 的零样本定位上多数指标优于此前的多任务零样本方法。
深度剖析
SentZero 提出以句子为中心的视觉-语言预训练框架,预训练后可直接迁移到多种下游任务,无需任何任务特定的微调。 此前多数胸部 X 光视觉-语言预训练方法在对比预训练之后仍需在带标注数据集上做任务特定微调,而 SentZero 把零样本多任务迁移作为设计目标。 论文在 MIMIC-CXR(377K 图像、227K 检查、65,379 名患者)上预训练,并在 Open-I、ChestXray14、PadChest、ChestXDet10、CheXpert 分类与 ChestXDet10、MS-CXR 定位上评测;作者说明评测图像已排除在 SentZero 训练与所用 RAD-DINO 检查点的预训练数据之外。
抽象级句子映射把详细发现句映射为“主题-存在性”的简洁句(如“There is mild opacity in the bilateral lung base”简化为“There is opacity”),作为额外正样本对加入对比学习,从而扩充正样本对多样性。 此前的句子级方法用大语言模型抽取临床短语,但把每个抽取句当作其自身图像的独立描述,未利用放射报告的分层语义结构;SentZero 用同一批短语生成两个粒度上的监督。 消融显示,在多层级特征聚合之上加入抽象级映射后,OpenI 从 0.8741 升至 0.8856、ChestXray14 从 0.8164 升至 0.8323、ChestXDet10 分类从 0.8093 升至 0.8395、ChestXDet10 定位从 0.6655 升至 0.6811。
针对跨患者重复出现的临床等价句造成的假阴性,SentZero 不修改对比学习的配对关系,而是用辅助损失把每对假阴性中相似度最高的前 20% 补丁拉向该句子。 已有工作(如 CoNNs)用结构化临床概念对跨患者配对做重标注或剔除;论文报告直接掩蔽或重标注假阴性对在多数基准上不如不做处理,而补丁级选择性吸引在保留原对比目标与配对关系的同时带来提升。 表 3 中,假阴性重标注在 ChestXDet10 定位降至 0.5138、MS-CXR 降至 0.7066,掩蔽在多数数据集上也低于“None”基线;完整模型在 OpenI 0.8891、ChestXray14 0.8389、ChestXDet10 定位 0.7315、MS-CXR 0.9222 上取得最好或接近最好的结果。
句子条件化的残差调制用 FiLM 以句子嵌入预测尺度与偏移,对注意力池化后的视觉特征做样本特定修正,使视觉表示随输入句子的语义变化。 此前的文本条件多用于空间注意力;SentZero 把条件化扩展到聚合后的视觉特征,并通过残差连接保留原始视觉内容。 消融中单独加入文本条件化在 PadChest(0.8652)与 CheXpert(0.9162)上高于完整模型,但完整模型在其余五个基准上以更大差距领先;附录表 4 显示把文本特征替换为重复的聚合补丁特征后,多数数据集性能下降。
启示与展望
该工作面向使用配对图像-报告数据做胸部 X 光视觉-语言预训练的研究与工程场景:预训练语料为 MIMIC-CXR,评测覆盖 Open-I、ChestXray14、PadChest、ChestXDet10、CheXpert 的多标签分类与 ChestXDet10、MS-CXR 的定位,方法在无需任务特定微调的前提下直接迁移。它适用于希望以自然语言提示驱动分类与定位、并愿意引入大语言模型做句子结构化与映射的团队;抽象级映射依赖 Qwen3-Next-80B,短语抽取沿用 RadZero 的 LLaMA3-70B-Instruct 结果,因此流程的可复现性取决于这些外部模型与提示模板。
论文报告的是在所列公开基准上的零样本结果,尚未涉及前瞻性临床工作流或真实部署中的表现;抽象级映射与短语抽取依赖外部大语言模型,其输出质量与提示模板变化对结果的影响在正文中未系统展开;假阴性损失系数与补丁采样比例的附录表显示不同取值在个别数据集上互有高低,最优配置可能随任务而变;此外,正文以表格与注意力图呈现结果,未给出逐类别的误差分析,读者若关心特定病理的失败模式仍需查看附录与原始数据。
