SegDINO用轻量尺度建模改造DINOv3,在四个数据集上以27.68M参数和51 FPS取得最优分割精度
核心概要
该工作提出SegDINO,用冻结的DINOv3-S编码器提取第3、6、9、12层中间特征,通过Token Pyramid Adaptation(TPA)把同分辨率token重排为1/4至1/32的伪多尺度金字塔,再用Scale-Aware Decoding(SAD)做尺度内细化与自顶向下跨尺度传播,并发布含284例胰腺癌患者CT的PanCT数据集;在PanCT与TN3K、Kvasir-SEG、ISIC三个公开基准上,SegDINO的DSC与HD95均优于U-Net、SegNet、R2U-Net、Attention U-Net、TransUNet、U-NeXt、U-KAN,模型共27.68M参数、推理速
Fig. 1: An overview of the proposed SegDINO framework. A frozen DINOv3 en- coder extracts intermediate features from multiple layers. These features are first projected and reorganized by the Token Pyramid Adaptation (TPA) module to construct a pseudo multi-scale pyramid, introducing scale-aware representations. The resulting pyramid is then processed by the Scale-Aware Decoder (SAD), which performs intra-scale refinement and inter-scale information propagation using a residual refinement operator R. Finally, a lightweight prediction head produces the segmentation output.
· 第 3 页深度剖析
SegDINO把DINOv3的中间层token重排为伪多尺度金字塔,用尺度建模替代重型解码器,在四个数据集上同时取得最优DSC与HD95。 此前适配DINO系特征的分割方法多依赖堆叠多尺度融合模块或复杂上采样管线,本文改为在冻结DINOv3-S的第3、6、9、12层特征上做1×1投影与步长卷积重采样,构造1/4、1/8、1/16、1/32的伪金字塔。 在PanCT与TN3K、Kvasir-SEG、ISIC四个数据集上与七种基线比较,Table 1显示TN3K上DSC较最强基线TransUNet高3.64%、HD95低7.50,Kvasir-SEG与ISIC上DSC分别较SegNet和U-KAN高4.64%和2.41%。
消融显示TPA是性能提升的主要来源,SAD提供轻量补充,且两者收益随目标尺度变化。 基线Basic把多层编码器特征投影到统一通道并在单一分辨率拼接;M1仅加TPA,M2仅加SAD,完整模型两者并用。 Table 2中PanCT上Basic为0.7758 DSC,M1升至0.8525(约+7.7% DSC),M2仅0.7906,完整模型0.8657、HD95 2.61;TN3K上各配置差异较小(0.8318至0.8391)。
作者构建了PanCT数据集,用于评估小病灶分割,含284例确诊胰腺癌患者的专家标注CT。 该数据集来自放射科,243例用于训练、41例用于内部测试,训练队列中位年龄59岁(94女、149男),测试队列中位年龄56岁(20女、21男),由两名经验丰富的放射科医生独立标注,数据在机构伦理批准下去标识。 3D CT体数据被转为2D轴位切片以进行切片级建模并与2D基线公平比较,作者说明这损失了层间上下文,并将2.5D/3D扩展留作未来工作;数据不公开,可向通讯作者合理请求获取。
SegDINO在精度与效率之间取得平衡,参数量与推理速度均具竞争力。 模型总计27.68M参数,其中DINO-S骨干21.60M、其余组件6.08M,作者称其已优于多数Transformer类对手。 推理速度达51 FPS,超过多数Transformer架构并与轻量卷积模型相当;Fig. 3给出参数量、DSC与FPS的对比。
启示与展望
该结果面向以2D轴位切片为输入、使用冻结DINOv3-S编码器的医学图像分割场景,适用于甲状腺结节、结肠息肉、皮肤病灶与胰腺肿瘤等已评估任务;对希望以较少参数和较高推理速度获得多尺度分割能力的读者,TPA与SAD提供了可直接复用的模块化设计,代码已在 https://github.com/script-Yang/segdino_v2 公开。
PanCT数据不公开、仅可向通讯作者请求,外部复现与跨中心验证仍待观察;3D体数据被转为2D切片,层间上下文的影响尚未评估;作者在结论中列出更广泛比较与消融、跨模态与临床场景泛化、3D体分割扩展为未来工作,这些方向的结果尚不可知;本文为全文解析,但图表以文本形式呈现,Fig. 2与Fig. 3的细节无法从文本中完整核对。
