TranSamba 用跨平面 Mamba 把弱监督体数据分割的 DSC 推到 64.1%,在 BraTS、KiTS、LASC 三个数据集上均居首
核心概要
该工作提出 TranSamba——在 DeiT-S 视觉 Transformer 编码器的每一层 Transformer 之前串联一个跨平面 Mamba(CPM)块,让相邻平面间的 patch token 以线性时间交换信息,从而改善平面内自注意力与类到 patch 注意力图;在仅使用平面级标签、每批 16 个含 16 个连续平面的体数据、训练 100 轮设置下,它在 BraTS、KiTS、LASC 测试集上分别取得 64.1%、26.8%、41.0% 的 DSC 与 46.8%、25.8%、25.6% 的 IoU,均为所比较方法中最高,且时间复杂度随平面数线性增长、批处理空间复杂度与平面数无关。
深度剖析
提出 TranSamba 混合架构:CPM 块与 Transformer 块逐层串联,CPM 负责跨平面建模,Transformer 负责平面内自注意力并输出 C2P 注意力图。 已有弱监督体数据分割方法多依赖 2D 编码器,忽略体数据的第三维;跨平面自注意力虽能建模体积性但随平面数 N 二次增长,而 Mamba 提供线性时间替代。 论文给出复杂度推导:TranSamba 时间复杂度为 128MND+4MD²+2M²D,随 N 线性;若把跨平面 SSM 换成 SA 则变为 4MND²+2M²N²D+4MD²+2M²D,随 N 二次增长;空间复杂度 B(4MD²+2M²D)+(B/N)(128MND) 与 N 无关。
跨平面建模是性能提升的主要来源,而非模型复杂度增加。 作者设置 V2 作为复杂度与 V3 相当的对照(Transformer 与平面内 Mamba 交替,等价于 Vision Mamba 前向分支),用以分离“复杂度”与“跨平面建模”两个因素。 消融中 V3 相对 ViT-only 基线 V1 提升明显(BraTS 60.7% vs 40.7% DSC,KiTS 25.1% vs 15.8%,LASC 45.9% vs 33.5%),而复杂度相近的 V2 提升小得多(41.9%/19.5%/38.1%);纯 Mamba 变体 V4、V5 表现明显更差,V5 仍优于 V4。
在三个覆盖不同模态与病理的数据集上,TranSamba 的 DSC 与 IoU 均高于所比较的弱监督方法。 AME-CAM、UM-CAM 的动态多尺度特征聚合与 IAT 的焦点损失加自监督在 BraTS 上有效,但在 KiTS 与 LASC 上明显下降;TranSamba 在三者上表现更一致。 测试集上 TranSamba 为 BraTS 64.1/46.8、KiTS 26.8/25.8、LASC 41.0/25.6(DSC/IoU),相对各数据集第二名平均高出 5.3%(DSC)与 2.4%(IoU);对比方法包括 Grad-CAM、Grad-CAM++、FullGrad、Ablation-CAM、Score-CAM、SEAM、LayerCAM、TS-CAM、SIPE、AME-CAM、UM-CAM、IAT。
平面数与层序设计影响效果:16 个平面的局部跨平面建模最优,CrossIn(CPM 在 Transformer 之前)取得并列最高排名 1.83。 作者系统比较了 16/32/64/128 个平面以及 Parallel、InCross、CrossIn 三种层序,并报告 HD95 以区分 DSC/IoU 接近的变体。 16 平面在三个数据集上 DSC 最高(BraTS 60.7、KiTS 25.1、LASC 45.9);CrossIn 的 HD95 为 BraTS/KiTS/LASC 4.6/15.2/3.2,Parallel 为 4.8/15.5/3.1,InCross 为 3.8/15.4/3.6。
启示与展望
该结果面向以平面级标签训练的二分类体数据分割,适用于 CT 与 MRI 中连续、跨有限平面数的目标结构,例如 BraTS 的 T2 FLAIR 全肿瘤、KiTS 2023 的肾脏肿瘤与 LASC 的左心房腔;训练配置为每批 16 个含 16 个连续平面的体数据、100 轮、单张 40GB A100。它使后续工作可以在不引入多尺度聚合、边界/尺寸处理、自监督正则或目标特定约束的前提下,仅靠架构获得更好的定位图;作者也指出未来可扩展到多分类场景并引入辅助技术以更贴近临床应用。
读者仍需留意:任务被限定为二分类,多分类需要共现、类间或通道间相关性等正交技术;性能随目标尺寸正相关,KiTS 的 tiny 子组 DSC 仅 5.1%、small 子组 21.3%,小目标仍是开放问题;KiTS 的 huge 子组中 FullGrad 的 66.1% 高于 TranSamba;LASC 训练集仅 43 个研究,KiTS 与 LASC 背景为噪声腔体;作者自述 TranSamba 用于临床仍需后处理或多步方法,且 V4、V5 速度偏低源于实现效率。此外,本文为快速解析,图 1、图 2 的具体内容与部分表格排版细节无法从文本完全还原,定性对比与尺寸-DSC 相关性的细节以原文图表为准。
