Open-PMC-18M 用子图拆分与上下文摘要构建 1800 万医学图文对,检索平均召回提升 27%
核心概要
该工作从 BIOMEDICA 语料出发,用基于 DAB-DETR 的子图检测、Qwen2.5-VL-32B-Instruct 的子图注提取和 Qwen2.5-14B-Instruct 的正文上下文摘要,构建并公开了含 1800 万子图-文本对的 OPEN-PMC-18M 数据集,并在放射、显微与可见光摄影三类模态的 6 项检索与 19 项零样本分类任务上训练视觉-语言编码器,报告检索平均召回 21.64、较此前最佳模型 OPEN-PMC 相对提升 27%,零样本分类总体平均 F1 达 39.77。
Supplementary Material, Fig. S2). Amplification of the der(1) junction fragment by suppression PCR retrieved the 5q31.2 breakpoint, which was confirmed by FISH (Fig. <xref ref-type="fig" rid="ddv00401">1</xref>E; E;
· 第 1 页深度剖析
作者构建并公开了 OPEN-PMC-18M:1800 万条子图-文本对,每条文本由从原图注中逐字抽取的子图注与一段正文上下文摘要组成,覆盖显微(约 73%)、放射(约 18%)、可见光摄影(约 8%)与其他临床影像(约 1%)。 此前 PMC 系数据集(PMC-OA、PMC-15M、BIOMEDICA)以整幅复合图配整段图注成对,未同时做子图拆分与上下文摘要;作者称尚无先前工作把两者联合纳入统一的生物医学视觉-语言数据集。 数据规模与模态占比在正文统计中给出;子图注抽取经人工抽查 1000 例,报告 94% 正确,13.28% 的子图注实为整段图注的逐字复制。
作者训练了基于 DAB-DETR 的子图检测器,用程序化合成的 50 万张复合图作为训练集(另用 2 万张留出集验证),在合成验证集上 mAP 98.58%、F1 99.96%,在 ImageCLEF 2016 上 mAP 36.88%、F1 73.55%。 此前同类工作(Lin 等)在 MedICaT 的 2069 张人工标注复合图上训练 DETR;作者改用大规模合成数据以获得真值边界框,并称该合成语料在生物医学领域属首次。 与 MedICaT 训练的 DETR 及零样本提示的 Qwen2.5-VL-32B-Instruct 在同一评测集上对比,两项指标均更高;合成验证集与真实基准 ImageCLEF 2016 的差距也一并报告。
在 OPEN-PMC-18M 上训练的编码器在跨模态检索上取得平均召回 21.64,较此前最佳 OPEN-PMC 相对提升 27%,并在 19 项零样本分类任务中 13 项第一、1 项第二,总体平均 F1 为 39.77。 作者在统一架构(PubMedBERT 文本编码器 + ImageNet 预训练 ViT-B/16)与统一训练协议下重训 PMC-6M 与 PMC-OA 作为对照,使数据集差异而非模型差异成为主要变量。 检索报告 Recall@200(附录另给 Recall@10、Recall@50),分类报告零样本与线性探针两套结果;扰动鲁棒性用 Wilcoxon 符号秩检验,在 Quilt 与 DeepEyeNet 上 p<0.01。
消融显示,仅把整段图注换成子图注并未带来检索增益甚至略有下降,而在此基础上加入正文上下文摘要后性能显著上升。 这为“子图注更局部精确但过于稀疏、需要上下文摘要补回语义与临床背景”提供了直接实验对照,而此前上下文增强基本未被处理。 消融限定在 OPEN-PMC-18M 的放射子集(320 万图文对),三种设置共用同一编码器架构、优化设置与对比目标,结果在 MIMIC-CXR 上比较。
启示与展望
该数据集面向从 PubMed Central 开放获取文献中挖掘的放射、显微与可见光摄影图像,适用于以对比学习训练检索与分类编码器的研究场景;作者明确模型不用于临床部署,并指出若被微调用于临床应用,在缺乏严格验证与临床安全考量时存在风险。作者也把后续方向指向与语言模型解码器结合,用于医学报告生成与视觉问答等生成式任务,并评估其事实一致性。
作者指出仍需更多分析才能完整评估泛化性,并提示数据源自开放获取文献,可能带有特定机构、成像协议或发表惯例带来的偏差,在代表性不足的人群或不同临床环境中可能限制泛化。生成式下游任务的事实一致性与可解释性仍是开放问题。此外,正文中部分图表(如鲁棒性图与嵌入可视化)以图像形式给出,具体数值需查阅附录表格。
