跳到主要内容
返回时间线
arXiv来源发表:

TotalFM 用器官分离的 3D-CT 基础模型在零样本病灶分类中于 83%(25/30)的征象类别上超过 Merlin,并以 32 batch/GPU 的批量效率训练

核心概要

该研究提出 TotalFM,一个基于器官分离思路的 3D-CT 放射学基础模型:它用 TotalSegmentator 与 LLM 自动构建约 34 万个器官级“体积—文本”配对,先以 VideoMAE 自监督预训练、再做器官级对比学习,在零样本器官级病灶分类中平均 F1 达 0.708(CT-CLIP 为 0.515、Merlin 为 0.650),在 83%(25/30)的征象类别上 AUROC 高于 Merlin,并在报告生成上取得与 Merlin 相当的表现,同时把批量效率提升到 32 batch/GPU。

Source-provided article image: TotalFM: An Organ-Separated 3D-CT Foundation Model Leveraging Large-Scale Routine Clinical Radiology Data

深度剖析

提出器官分离的对比学习框架,把全身 CT 体积按解剖器官拆分为 192×192×32 的器官块,与对应报告句子在共享嵌入空间中对齐,实现器官级“体积—文本”表示学习。 以往 3D 基础模型多以整份报告对整体体积做对比学习,本研究把粒度细化到“具体征象句—器官体积”,并显式约束器官级语义对应。 在零样本器官级病灶分类中,TotalFM 平均 F1 为 0.708,CT-CLIP 为 0.515、Merlin 为 0.650;相对 CT-CLIP 平均提升 37.5%,相对 Merlin 提升 6.5%,且所有被评估器官标签的 F1 均超过 0.6。

通过器官分离与分块设计显著降低计算开销,使高分辨率 3D-CT 对比学习可以用大批量进行。 论文对比显示 CT-CLIP 为 2 batch/GPU、RadFM 为 1 batch/GPU、Merlin 为 18 batch/GPU,而 TotalFM 在 H100 上达到 32 batch/GPU,输入分辨率为 192×192×32、约 180 GFLOPs。 批量效率数据来自作者在自有实现环境(H100、bf16、控制器官块数量)的初步实验,并以表 1 与相关工作进行对照。

构建全自动的大规模数据流水线,整合 TotalSegmentator 与 LLM,从 14 万例 CT 序列生成约 34 万个器官级“体积—文本”配对。 流水线包含报告拆分、最优序列选择、区域/相位分类、征象—序列匹配、器官抽取五步,并额外用规则模板补充约 11 万个阴性配对以学习正常解剖。 训练集含 224,117 个原始报告句配对与 107,035 个规则阴性配对;区域分类器在头、颈、胸、腹、盆的 AUROC 分别为 0.9974、0.9654、0.9708、0.9897、0.9839。

在视觉—语言模型微调中,用 Q-Former 与 LLM 的 LoRA 微调同时训练,并加入器官特定嵌入,直接学习与 LLM 的连接。 不同于 BLIP-2 先做视觉表示学习再对齐语言空间的两阶段方案,本研究同时训练 Q-Former 与 LoRA,以缓解模态鸿沟;报告生成时只输入目标区域可识别的特定器官,而非整个 CT 体积。 在按器官的报告生成定量评估中,TotalFM 在胆囊与盆腔器官的所有指标上均优于 Merlin,其余器官总体相当;平均 BLEU 为 0.164(Merlin 0.151)、ROUGE-2 为 0.460(Merlin 0.456)。

启示与展望

该框架面向以器官为单位的 3D-CT 分析场景,适用于希望用有限 GPU 资源训练高分辨率体积基础模型的团队,以及需要器官级病灶筛查、图像—文本检索或作为下游 CAD 微调基座的临床研究环境。论文指出,对 CT 中每个器官分别推理即可构建覆盖整个体积的自动化诊断流程,例如把征象句的文本嵌入作为可检索索引;同时,器官级分类任务使用真实报告句子,被视为一种二元视觉问答形式,有助于减少提示工程波动带来的性能起伏,并可能为 3D-CT 基础模型评测的标准化提供候选方案。

读者仍需留意若干开放问题。其一,与 TotalSegmentator 解剖标签不对应的征象被排除,血管系统(主动脉除外)与淋巴系统相关征象大多未进入训练数据,未来需要开放词汇分割或视觉定位来定位征象句对应的区域。其二,InfoNCE 把小批量内所有非配对元素当作负例,可能引入噪声,因为某些非配对组合实际上可能是阳性发现。其三,研究只选取单一代表性 CT 序列,而临床诊断常需比较多个序列以观察强化动态等时间变化。其四,研究聚焦单个征象,如何把离散征象整合为整体诊断仍待探索。其五,在征象级分类中,主动脉与肺野等沿 z 轴延伸或分为多个标签的器官表现与 Merlin 相当或略低,作者将其归因于滑动窗口下对多个图像嵌入相似度取平均稀释了局部病灶信号。其六,报告生成的人类评估由单一具有 10 年以上经验的放射科医师完成,属于定性示例分析。其七,数据因患者隐私与伦理限制不公开,代码与权重为计划公开。

来源