跳到主要内容
返回时间线
arXiv来源发表:

用七个模型替换四个腹部CT数据集的人工标注后,预训练对标签质量的依赖消失,而直接部署仍高度依赖

核心概要

该研究在WORD、AMOS、CT-1K和AbdomenAtlas四个腹部CT数据集上,用nnU-Net、MedSAM、TotalSegmentator及四个规模的STU-Net共七个模型生成伪标签,构造不同质量的标签版本,再以DynUNet在相同确定性训练设置下分别做域内训练和预训练加微调;结果显示域内性能与标签质量强正相关且呈非线性、数据量可部分补偿质量,而预训练后微调在绝大多数设置下显著优于无预训练基线,且预训练标签质量高低不再明显影响下游结果。

Source-provided article image: Good Enough? An Investigation on the Impact of Label Quality in Large-Scale Medical Datasets

深度剖析

研究系统刻画了伪标签质量谱:nnU-Net在各数据集上Dice最高(83.7%至95.2%),MedSAM最低(AbdomenAtlas上Dice 39.4%、Surface Dice 24.8%),STU-Net由small到huge随规模提升但增益递减,TotalSegmentator居中。 以往标签噪声研究多依赖形态学操作或扰动合成噪声,或聚焦2D与RGB模态;这里用真实伪标签误差、原生3D模型,覆盖四个数据集与七个生成器。 基于Table 1的Dice与Surface Dice均值与标准差,以及Figure 1的ECDF曲线;仅统计所有生成器都能预测的解剖结构以保证可比。

域内训练中标签质量与模型性能强正相关,但关系非线性,高质量端出现收益递减并低于y=x参考线;数据量可补偿质量,AbdomenAtlas(5k例)性能较早进入平台期,而Word、Amos等小数据集对标签改进更敏感。 把质量-性能关系放到不同数据规模上比较,指出质量投入的边际价值随数据量增大而下降。 Figure 2的散点与二次多项式回归,覆盖四个数据集、Dice与Surface Dice两种指标。

预训练场景下标签质量不再是主要因素:用MedSAM这类低质量伪标签预训练后微调,模型仍显著优于无预训练基线,并达到与高质量预训练标签相当的水平;在固定计算预算下,预训练数据集大小(Word、Amos对比AbdomenAtlas)也未显示明显影响。 作者称这是首个隔离预训练标签质量与微调后下游性能关系的基准,把标签质量影响从推理模型扩展到预训练阶段。 Figure 3在SegThor与FLARE两个目标数据集上的全局与器官级Dice/Surface Dice,显著性由单侧Wilcoxon符号秩检验给出;作者另将基线训练从1k延长到2k步以验证增益来自数据而非训练时长。

作者据此提出两条可操作建议:面向大规模预训练语料的数据集创建者,广泛专家精修可能不具成本效益;模型开发者可用简单伪标签处理未标注图像集合以获得可迁移表征。 把标签质量研究从方法改进转向数据策管决策,给出资源应投向预训练语料还是下游目标数据集的判断依据。 结论建立在四个数据集、七个生成器、两个下游目标数据集的一致模式上,属于该实验设置内的经验性建议。

启示与展望

该研究面向腹部CT多器官分割,使用DynUNet与nnU-Net风格训练流程,预训练标签由nnU-Net、MedSAM、TotalSegmentator和STU-Net四个规模变体生成,下游目标为SegThor与FLARE。其结论适用于“大规模伪标签预训练加高质量下游微调”这一工作流,以及需要在无人工标注条件下直接部署的对照场景。对数据集创建者,它提示预训练语料的专家精修投入可以重新评估;对模型开发者,它提示未标注图像集合的简单伪标签即可用于学习可迁移表征。

预训练为何能补偿标签噪声,文中以“预训练主要传递一般结构知识而非细节”作为假设,尚未直接验证。质量-性能关系在高质量端的平台期、以及数据量补偿质量的现象,其机制仍待进一步刻画。结论基于腹部CT与DynUNet,其他模态、任务与架构是否呈现同样模式是开放问题。此外,MedSAM被有意用作低质量标签代理,其2D到3D堆叠带来的伪影属于该代理的构造方式,而非对交互式基础模型能力的普遍结论。

来源