跳到主要内容
返回时间线
arXiv来源发表:

ProSMA-UNet 用 ℓ1 近端稀疏门控替换 U-Net 跳连的稠密注意力,在 2D 与 3D 医学分割基准上取得最优,3D 结肠任务 F1 提升约 19%。

核心概要

该工作提出 ProSMA-UNet,把 U 形医学分割网络的跳连重写为“解码器条件化的稀疏特征选择”问题:先用轻量深度可分离空洞卷积构建多尺度编解码兼容场,再用带可学习逐通道阈值的 ℓ1 近端算子(闭式软阈值)产生显式稀疏门,并叠加由全局解码器上下文驱动的通道门控,在 BUSI、GlaS、Kvasir-SEG 三个 2D 基准与 Medical Segmentation Decathlon 的 Spleen、Colon 两个 3D 基准上均报告最优结果,其中 Colon 的 F1 相对最强基线提升约 19%。

Source-provided article image: ProSMA-UNet: Decoder Conditioning for Proximal-Sparse Skip Feature Selection
Fig. 1

Fig. 1. ProSMA-UNet motivation and overview. (a) Conventional attention gates generate a dense soft mask (sigmoid reweighting), which can still pass weak but harmful skip activations (noise features) into the decoder. (b) Our ProSMA sparse gating constructs a multi-scale decoder–encoder compatibility field and applies an ℓ1 proximal (soft-thresholding) operator to induce explicit sparsity (exact zeros), enabling direct removal of irrelevant skip responses. (c) ProSMA-UNet integrates the proposed sparse gating module at each skip connection to condition high-resolution feature transfer on decoder context. (d) Overview of ProSMA Spare Gating.

· 第 4 页

深度剖析

论文把跳连门控形式化为解码器条件化的稀疏特征选择问题,而非稠密重加权,并指出跳连是噪声与背景泄漏进入解码器的主要通路。 相对 Attention U-Net 等使用 sigmoid 稠密掩码的做法,该工作主张“衰减”与“移除”的区别,把跳连视为在解码器上下文下只保留相关分量的选择算子 Gs:(xs,gs+1)→x̃s。 属于问题重构与动机论证,配合图 1(a)(b) 的示意对比说明注意力掩码无法滤除噪声而近端稀疏门可以置零;该部分为概念性论证,非定量实验。

ProSMA 门控由多尺度兼容场与 ℓ1 近端稀疏两步构成,得到闭式软阈值规则,可将不相关激活置为精确零。 兼容场 u=fms(ReLU(q+k)) 用深度可分离空洞卷积聚合多个感受野,保持通道独立以配合逐通道稀疏;稀疏通过 z*=prox_{λ‖·‖1}(u)=sign(u)max(|u|−λ,0) 实现,λ=softplus(θ) 为可学习逐通道阈值。 方法推导完整,给出式(1)–(5)与闭式解;稀疏性由软阈值的死区性质直接保证,属于解析结果而非经验观察。

论文给出定理 1,证明近端稀疏门控具备精确特征选择与稳定性:阈值增大只会移除活跃特征,且算子非扩张(1-Lipschitz),不会放大兼容场中的噪声。 相对仅凭经验验证的注意力门控,该工作为稀疏门控提供了单调稀疏性与非扩张性的形式化保证,并给出逐项软阈值与 Frobenius 范数比较的证明。 定理与证明在正文中给出,论证基于软阈值函数分段线性、斜率落在 [0,1] 的性质,属于理论分析。

在三个 2D 与两个 3D 医学分割基准上报告一致最优,且 3D 困难任务增益最大;消融显示空间稀疏与通道门控互补。 BUSI 上较最强对比提升 +2.86 IoU / +2.43 F1,GlaS 上达 88.76±0.14 IoU / 94.04±0.08 F1,Kvasir-SEG 上达 66.23±2.15 IoU / 85.43±1.19 F1;3D 上 Spleen 为 97.59±0.10、Colon 为 63.14±0.99,后者较 UKAN2.0 3D 高 +10.09(约 +19.0% 相对)。消融中完整模型 F1 为 80.13,较无 PSG 的 74.05 提升 +6.08。 2D 结果报告为三次独立运行并给出标准差;3D 结果以 F1 报告;消融在单一设置下比较四种门控配置。基线结果部分取自 U-KAN 的相同协议,UKAN2.0 因 GPU 显存限制未在 GlaS 上评估。

启示与展望

该结果面向以 U 形编码器–解码器为骨干的医学图像分割任务,适用于低对比度、噪声明显的 2D 与 3D 临床成像场景,例如乳腺超声、组织病理、内镜息肉以及腹部 CT 的脾与结肠肿瘤分割。对希望减少跳连噪声泄漏、又不想改动整体骨干结构的研究者与工程实现者,ProSMA 门控可作为跳连处的替换模块;论文同时给出闭式软阈值实现与定理保证,便于在既有管线中直接嵌入。

论文报告的是在所列基准上的表现,其他解剖目标、成像模态与跨中心数据上的行为仍需观察;3D 结果以 F1 报告,2D 结果报告为三次运行均值与标准差,不同任务的评价口径不完全一致。消融在单一设置下比较四种门控配置,稀疏阈值 λ 的取值分布与可学习阈值随训练的变化未在正文中展开。基线结果部分沿用 U-KAN 的相同协议,UKAN2.0 因 GPU 显存限制未在 GlaS 上评估,因此该数据集上的对比范围有限。此外,本次读取为全文,但图 2 的定性可视化与误差图仅以文字描述呈现,具体病例层面的差异无法从文本中逐例核对。

来源