冻结 DINOv3 编码器加 FAPM 投影的 Dino U-Net 在七个医学影像数据集上取得最优分割,7B 版本平均 Dice 达 76.43%
核心概要
该工作提出 Dino U-Net:以冻结的 DINOv3 基础模型为编码器,配合双分支 DINO Adapter 与保真感知投影模块(FAPM),在七个公开医学影像数据集(内镜、超声、显微、MRI、眼底、CMR 等模态)上取得优于七种基线方法的分割表现,并显示性能随骨干从 S 扩展到 7B 而持续提升。
Fig. 1. Architectural overview of the Dino U-Net. The encoder consists of a frozen DINOv3 backbone, a DINO Adapter, and a Fidelity-Aware Projection Module (FAPM), connected to a standard U-Net decoder.
· 第 4 页深度剖析
提出 Dino U-Net 混合架构,用冻结的 DINOv3 作为编码器并接入标准 U-Net 解码器,通过双分支 DINO Adapter 弥合自然图像预训练特征与医学图像之间的域差异。 此前将基础模型编码器接入 U-Net 的工作多基于 SAM 系列(如 SAM2-UNet),而 DINOv3 的高保真稠密特征在医学分割中的潜力被作者描述为尚未充分探索。 论文给出完整的架构描述与图示(Fig. 1),并在七个公开数据集上与七种基线对比;作者称多数改进具有统计显著性(Wilcoxon 符号秩检验,p<0.05)。
设计保真感知投影模块(FAPM),通过低秩共享卷积与特定卷积解耦、由共享特征生成缩放因子 α 与偏移因子 β 做仿射调制,再经细化路径与捷径路径融合,在降维时保留细粒度信息。 作者指出线性层或 1×1 卷积等朴素投影会牺牲细粒度细节,FAPM 针对这一降维环节做了专门设计。 消融实验(Table 4)显示,用 1×1 卷积替换 FAPM 后各尺度 Dice 最多下降 0.79%、HD95 最多恶化 1.75mm;FAPM 在小模型上仅增加 0.2–0.5M 参数,在 7B 模型上反而减少 0.8M 参数。
在七个公开数据集上,Dino U-Net 各尺度变体整体优于 nnU-Net、SegResNet、UNet++、U-Mamba、U-KAN、Swin U-Mamba 与 SAM2-UNet;7B 版本在七个数据集中的五个刷新纪录,平均 Dice 76.43%(+1.87%)、HD95 18.76(-3.04)。 作者称这是首次系统地把 DINOv3 的稠密特征用于医学分割,并同时报告区域精度与边界精度两类指标。 评测覆盖内镜、超声、显微、MRI、眼底、CMR 等模态,数据集规模从 25 例(MyoPS20)到 1044 例(CellBinDB)不等;采用 Dice 与 HD95 两项指标,并报告显著性检验结果。
框架表现出可扩展性:随着骨干从 S 增大到 7B,分割性能持续提升,且最小的 S 变体(5.11M 参数)平均表现已超过所有基线。 作者将这一趋势作为证据,说明医学分割能从十亿级参数基础模型的表征能力中获益。 Table 3 给出各变体的活跃参数量与平均 Dice/HD95;7B 变体参数量为 228.97M,推理开销被作者列为仍需关注的问题。
启示与展望
该框架面向二维医学图像分割任务,适用于内镜、超声、显微、MRI、眼底与 CMR 等模态下的器官、病灶与细胞分割场景。对希望以较小训练成本复用大规模自监督预训练表征的研究者与工程团队,论文提供了可复现的架构与公开代码(https://github.com/yifangao112/DinoUNet)。作者指出下一步是把框架扩展到三维体数据分割。
论文为二维设定,三维体数据上的行为尚待验证;7B 变体虽在多数数据集上领先,但参数量与推理开销明显更高,作者也把知识蒸馏列为后续方向。此外,评测基于公开数据集的随机 8:2 划分,跨中心、跨设备的外部验证结果在文中未给出。读者若只读到摘要,可能无法判断 FAPM 在不同尺度上的收益差异,这部分需要结合消融表理解。
