跳到主要内容
返回时间线
arXiv来源发表:

PC-Seg 用五阶段课程学习把稀疏 2D 标注提升为 3D OCT 分割,仅用约 0.7% 标注即达到全监督精度

核心概要

该工作提出 PC-Seg(Progressive Cross-view Segmentation),一个五阶段课程学习框架:先用单个 2D 模型在标准 B-scan 与正交切片之间学习跨视角一致性以生成可靠体素伪标签,再蒸馏到 3D 模型,最后通过 2D/3D 集成伪标签协同训练;在 MSHC 与 Duke DME 两个公开 OCT 数据集上,仅用约 0.7% 的标注数据即取得与全监督相当的分割精度,并优于所比较的半监督与视网膜分层方法。

Source-provided article image: PC-Seg: Progressive Cross-View Consistency for 3D OCT Segmentation from Sparse 2D Annotations
Fig. 1

Fig. 1. Overview of the five-stage curriculum learning in PC-Seg. The 2D model trained in Stage 3 is utilized again in Stage 5 for the final ensemble. The “Train” arrows in each stage denote the optimization using the baseline SSL framework in Sect. 2.1.

· 第 3 页

深度剖析

提出五阶段课程学习流程,把稀疏 2D 标注逐步提升为 3D 分割模型:Stage 1 用 B-scan 做 2D 预热,Stage 2 引入正交 B-scan,Stage 3 在正交平面间交叉教学,Stage 4 将 3D 伪标签蒸馏到 3D 模型,Stage 5 进行 2D/3D 协同训练。 与直接在正交平面标注或使用稠密体素标签的多视角方法不同,该方法只用单个 2D 模型学习跨视角一致性,从而适配 OCT 的强各向异性与稀疏标注条件。 论文以图 1 给出五阶段流程,并在 MSHC 上以 6 张标注图像做消融,逐阶段报告 F-score 从 Stage 1 的 0.8744 升至 Stage 5 集成预测的 0.9047。

跨视角一致性与正交切片作为额外无标注数据带来实质增益:Stage 2 引入正交 B-scan 后 B-scan 的 F-score 由 0.8744 提升到 0.8917,Stage 3 的交叉教学进一步缩小两个平面之间的性能差距。 消融中“Only stage 3”在缺乏 B-scan 先验学习时直接开始交叉教学,其 F-score 为 0.8713/0.8748,低于完整流程的 Stage 3(0.8952/0.8969),说明渐进式扩展维度与视角对抑制伪标签误差累积是必要的。 证据来自 MSHC 数据集 6 张标注图像的消融表,包含“Only stage 3”与“w/o ortho B-scan”两个跳过渐进步骤的对照设置。

在 MSHC 数据集上,PC-Seg 在 6、30、60 张标注图像三种设置下均优于所比较的 2D 与 3D 半监督基线;用 60 张标注图像(约 0.7% 训练数据)时集成预测 F-score 为 0.9174,接近全监督方法在全部 8,820 张图像上的水平(如 Structured-Layer 0.9193、1D+2D U-Net 0.9198)。 标准 3D 半监督基线(3D ResUNet w/ UM)在稀疏标注下提升有限(6 张标注时 0.7843),而该方法通过渐进课程在 2D 与 3D 学习之间搭桥。 证据为 MSHC 上的定量对比表,覆盖监督方法、领域专用半监督方法与通用半监督框架三类基线。

在 Duke DME 数据集上,该方法在 Fluid 类上取得明显改善,集成预测 F-score 达 0.742,而所比较的常规方法在 Fluid 类上约为 0.3–0.6;定性比较显示 3D 模型利用空间上下文平滑了正交 2D 预测的条带伪影。 该数据集标注稀缺且 Fluid 病变形态多样,方法通过引入 3D 空间上下文提升了对复杂病理结构的识别完整性。 证据为 Duke DME 上使用 66 张标注 B-scan(11 切片 × 6 受试者)训练的定量表与图 2 的定性对比。

启示与展望

该结果面向视网膜 OCT 体数据的分层与病变分割,适用于仅有少量标准 B-scan 标注、且可获得正交切片作为无标注数据的场景;框架被描述为模型无关,因此原则上可与其他 2D/3D 骨干组合,但本文实验限于 ResUNet(depth=4、base_channels=32)与 MSHC、Duke DME 两个公开数据集。对希望降低标注成本的眼科影像研究团队,这一流程提供了可复用的课程设计思路。

消融仅在 MSHC 的 6 张标注图像设置下进行,其他标注量下各阶段的贡献是否一致尚不清楚;病变类置信阈值在 Stage 4 与 5 降至 0.5 的做法依赖集成预测更稳定的假设,其在不同病变类型与数据集上的适用性仍需观察;此外,论文未报告推理时间或显存开销,实际部署成本需另行评估。

来源