开源自动大腿肌肉 MRI 分割算法的独立基准测评
核心概要
该预印本在 MyoSegmenTUM、AIPS、Sheffield 三个基础数据集及由 MyoSegmenTUM 衍生的病理子集与增强分布偏移数据集上,对八种开源大腿肌肉 MRI 分割工具(含可独立运行的六种与需提示的两种 SAM 变体)做独立头对头评测,结合 Dice、Jaccard、Hausdorff、边界 IoU、跨层 Dice 比等多指标与定性可用性审查,发现面向领域的 U-Net 模型尤其 MuscleMap 整体模型在多数数据集上优于基础模型与较新的通用架构,叠加 SAM 变体多数情况下反而降低分割质量,且多数工具在病理样本上表现下降。
Fig 1. Images from Sheffield dataset sample Aug-2 demonstrating poor labeling over the course of several muscles. The labeled muscles are shown in red. The left column shows the individual muscle label, while the right column shows all labels. The top row shows adductor brevis at slice 718, which is poorly labeled. The middle row shows gracilis at slice 718 with questionable labeling, while the bottom row shows gracilis at slice 738 with incomplete segmentation. The poor labeling of both muscles was present across multiple slices.
medRxiv · 第 5 页深度剖析
作者对八种开源大腿肌肉 MRI 分割工具做独立头对头评测,覆盖三个基础数据集以及衍生的病理子集(4 名神经肌肉病患者的 12 个双侧大腿 MRI 体数据)与增强分布偏移数据集;六种工具可独立运行,另两种 SAM 变体需要点或包围框提示。 文中指出此前尚无针对大腿肌肉 MRI 的独立头对头比较,既有综述或早于关键基础模型,或只做定性比较而无定量基准。 评测横跨多个数据集与多种连续指标(Dice、Jaccard、Hausdorff、边界 IoU、跨层 Dice 比等),并辅以定性图像审查;Table 4 给出各算法在每个数据集上的最佳 Dice 与排序。
面向领域的 U-Net 模型尤其 MuscleMap 在多数数据集上优于基础模型与较新的通用架构,并且大腿专用 MuscleMap 模型意外地低于其整体模型版本。 这为大腿肌肉 MRI 工具提供了首个共享基准上的定量排序,提示更广的训练数据可补偿任务专一性的降低。 Table 4 显示,例如 MuscleMap 整体模型在 AIPS 的 Dice 为 0.861、MyoSegmenTUM 为 0.825、增强集为 0.796、病理子集为 0.749、Sheffield 为 0.697;相比之下 Dafne 在相应数据集为 0.072、0.068、0.020、0.071、0.017。
在已有工具上叠加 SAM 变体多数情况下使分割质量下降,并出现把股骨或骨骼纳入肌肉标签的系统性现象,即使提示来自表现良好的算法。 该工作量化了 SAM 增强在多配置下的效果,并把下降与一个具体的定性失败模式联系起来。 MyoSegmenTUM 上的定性审查与在 MuscleMap WB、Dafne 上的 SAM 变体定量实验均显示总体下降趋势,偶尔在表现差的算法上有改善;作者报告 SAM 变体未能提升任何表现最好的算法。
多数算法在病理数据集上表现最差,部分算法在增强分布偏移数据上退化;这一模式在各工具间并不一致,MuscleMap 与 MuSeg 的 Dice 几乎不下降,而 MedCLIP-SAMv2 在仅增强条件下损失约一半 Dice。 这种分化把位置与朝向而非陌生解剖或疾病呈现分离为增强条件下退化的变量,也说明总体指标可能掩盖对最受累肌肉的差表现。 Table 4 按每个算法在各数据集的最佳 Dice 排序;病理子集包含 4 名患者的 12 个体数据,增强集由 4 名患病与 6 名健康受试者经手工质检为解剖可信的图像派生。
启示与展望
该评测的直接用途是帮助临床研究者、神经肌肉影像研究人员与转化团队,在大腿肌肉 MRI 的体积分析、影像组学与脂肪分数定量等场景中选择和使用开源工具;作者建议任何自动分割都配合视觉审查,在边界精度对临床关键的任务(如放疗计划)中还需人工复核与修正。评测框架、增强流程与数据已公开发布,便于随领域演进而周期性复评。
三份基础数据集的真值由单一专家标注(部分有放射科医生监督),未报告标注者间或标注者内可靠性;Sheffield 数据集的若干标注被指出存在不完整或可疑之处,因此准确度数值应理解为相对该真值的偏差。评测未覆盖每个数据集的全部肌肉,也未按性别分层;数据地理范围不包含非洲与美洲。不同工具期望的输入模态不同(脂肪分数、水像、Dixon),直接算法比较存在固有不对称。Table 3 标注 Multimodal-Multiethnic 以 MyoSegmenTUM 为训练数据,其在 MyoSegmenTUM 及衍生集上的成绩可能受数据泄漏影响。Dafne 在脚本模式下未启用其交互式校正流程,其数值反映未校正输出。本文加载的 markdown 中 Fig 1–11 图像已移除仅保留图注,若需核对骨误纳入、标签断裂等定性证据应查阅原文图表。快速演进的工具生态意味着结果是一个时点快照,病理数据上的退化趋势能否在其他数据集确认仍是开放问题。
