跳到主要内容
返回时间线
arXiv来源发表:

LightMIS 用 0.131M 参数在六套医学分割数据集上取得 86.71% 模态宏平均 Dice,并在手机 GPU 上实现 100% 算子委派

核心概要

该工作提出 LightMIS 系列超轻量卷积网络,用 Scale-Aligned Projection 块把五级编码器输出对齐到同一分辨率后一次性聚合、再由 Adaptive Fusion Cascade 精炼,从而取消逐级学习的解码器;在 nnU-Net v2.3.1 统一协议下对 DRIVE、Kvasir-SEG、DSB18、BUSI、ISIC-2017、ISIC-2018 做五折交叉验证,完整版以 0.131M 参数、0.575 GFLOPs 取得 86.71% 模态宏平均 Dice 与 78.99% IoU,与 Mobile U-ViT 的 86.75%/79.07% 相差 0.04 与 0.08 个百分点,同时参数减少 90.58–99.61%、GF

AI-generated editorial illustration: LightMIS: Ultra-Lightweight Medical Image Segmentation Without a Stage-Wise Decoder

深度剖析

提出 Progressive Receptive Fusion(PRF)模块,通过临时通道扩张、互补的深度可分离感受野以及分支间渐进式信息传递来增强窄通道特征表示。 与 TinyU-Net 的 CMRF 级联相比,PRF 的差别在于把每个已处理分支的通道平均空间响应在卷积之前传递给下一个分支,使信息传递不依赖两分支通道数匹配。 在 BUSI 与 Kvasir-SEG 上做了 PRF 消融:感受野多样性相对统一深度可分离处理提升两项指标,渐进式分支交互在 BUSI 重叠度上带来明显改善,而 Kvasir-SEG 重叠度提升较小、边界指标略偏向无交互变体;参数匹配的编码器替换实验中 PRF 取得最高宏平均 Dice,在 BUSI 与 DRIVE 领先。

提出 Adaptive Fusion Cascade(AFC),把取自 AULUNet 的 Adaptive Kernel Fusion(AKF,末层 ReLU 换为 GELU)、PRF 与残差自适应核精炼依次组合,用于每个编码器层级和最终聚合头。 相对单一 AKF 或单一 PRF 配置,完整 AKF–PRF–ResAKF 序列在 BUSI 上取得最高 Dice 与 IoU;把最终 AKF 换成 ResAKF 使模态宏平均 Dice 从 85.74% 升至 85.92%。 作者指出这些组合对比中不同配置参数量不同,因此不能把组合效应与模型容量分离,并补充了参数匹配的编码器与预测头对比;ResAKF 的收益在两个 ISIC 数据集和 DSB18 上出现小幅下降,作者据此按总体权衡保留该设计。

提出 LightMIS 直接聚合架构:SAP 块把全部五级编码器输出投影到共享通道宽度并双线性对齐到同一空间分辨率,拼接投影后由最终 AFC 精炼,再经轻量预测头输出并双线性还原到输入分辨率,全程不含对称多级解码路径。 与 FSE-Net、CBL-Net、FAN-Net 等无解码器工作主要聚焦视网膜血管分割不同,LightMIS 在统一 nnU-Net 协议下跨六个数据集、五种成像模态评估,且不做任务特定修改。 参数匹配的预测头对比中,SAP 加最终 AFC 在 BUSI、Kvasir-SEG、DRIVE 上 Dice 分别为 79.62%、87.52%、81.76%,宏平均 82.97%,高于 FPN-lite 的 82.56% 与参数匹配 U-Net 解码器的 82.38%;仅用最深特征的配置在 DRIVE 上 Dice 降至 52.62%,说明浅层编码器特征对细血管结构重要。

在统一 nnU-Net v2.3.1 协议下完成跨六数据集、五折交叉验证的评测,并给出桌面与手机端的复杂度、延迟与显存数据。 LightMIS 取得第二高的模态宏平均 Dice 与 IoU,以及六数据集上最佳的平均 Dice 排名;相对 Mobile U-ViT、nnWNet、nnU-Net 参数减少 90.58–99.61%、GFLOPs 减少 82.54–96.14%。 配对 bootstrap 与置换检验显示,在与 nnU-Net、nnWNet、Mobile U-ViT 的比较中,LightMIS 仅在 DRIVE 上同时满足置信区间整体高于零与校正后 p 值显著;作者明确把宏平均差异表述为数值接近而非统计优越。手机端所有变体实现 100% GPU 委派,但作者也指出 GFLOPs 不决定真实设备效率:UNeXt 与完整 LightMIS 计算量几乎相同(0.577 与 0.575 GFLOPs),在 Mali-G52 上却是 42.14 ms 对 138.43 ms。

启示与展望

该结果面向公开 2D 二值医学图像分割任务,覆盖视网膜血管、胃肠道息肉、细胞核、乳腺病灶与皮肤病灶五类成像模态,适用于需要在移动或资源受限设备上运行分割模型的场景。作者公开了实现、环境说明、精确五折划分、nnU-Net plan 文件、数据转换脚本、基线提交哈希、训练命令、检查点、指标实现、FLOP 计数脚本、LiteRT 转换代码以及桌面与手机基准脚本,便于在相同协议下复现与扩展。后续方向包括患者分组与外部验证、多类与体数据分割、在更多边缘处理器上的量化执行,以及把 PRF 与 AFC 推广到其他稠密预测任务。

DRIVE、ISIC-2017 与 ISIC-2018 的官方标注分区被合并后再做交叉验证,因此报告的是合并标签交叉验证结果而非官方挑战赛测试结果;交叉验证在图像级进行,未做受试者分组或类别分层,当同一受试者、病灶或采集序列贡献多张图像时,折间独立性无法保证。除 DRIVE 外图像被直接缩放到固定尺寸而未保持长宽比,可能改变解剖或病灶几何形态。模态宏平均先合并两个 ISIC 数据集为单一皮肤镜分数再等权平均五种模态,领先模型间差异很小,且当前配对分析基于固定的折外预测,未涵盖重复训练带来的变异。手机评测只覆盖一款智能手机 GPU 与一套软件栈,测量的是委派后的模型执行而非完整应用延迟,未涉及其他边缘处理器、持续热工况、能耗预算或临床流程。此外,统一 nnU-Net 协议对依赖预训练、不同优化器、深监督或模型特定训练计划的基线未必最优,作者也说明该协议提供受控比较但不一定对所有架构公平。

来源