在原型空间用注意力校准标注者差异,使少样本医学分割在CURVAS与QUBIQ上按标注者输出个性化预测并提升Dice
核心概要
该工作提出少样本多标注者医学图像分割问题,并给出以原型为中心的个人化框架:先由多标注者掩膜求平均得到共识掩膜与共识原型,再以每个标注者原型相对共识原型的偏差作为注意力键,用共享自注意力对拼接后的标注者原型进行校准,配合校准损失、由超像素伪标签经随机结构化边界变换生成的伪风格监督以及两阶段训练;在CURVAS腹部CT(肾、胰、肝,三位专家,20训练/65测试)与QUBIQ脑生长MRI(一位类别、七位标注者,34训练/5测试)上,以逐标注者Dice评估,方法在标准与严格未见类两种设置下相对SSL-ALPNet与DSPNet等原型基线取得一致提升,例如Abd-CT设置1中DSPNet由61.52升至
Fig. 1: Overview of the proposed framework. (a) Few-shot multi-rater segmenta- tion pipeline. Rater-specific and consensus prototypes are extracted from support features, and calibrated by the Joint Attention-based Prototype Calibration (JAPC) module to generate R personalized predictions via cosine similarity with query features. (b) Internal structure of JAPC, modeling structured inter- actions between rater prototypes and their deviations. (c) Pseudo-style genera- tion. Pseudo labels derived from superpixel/supervoxel segmentation are trans- formed to synthesize multiple rater-style variants, which are used as support labels and query supervision during training. The “Network” block in (c) corre- sponds to the full pipeline shown in (a).
· 第 4 页深度剖析
论文把“少样本多标注者分割”形式化为新问题:每张支持图像对每个类别带有R个标注者掩膜,模型需对查询图像输出R个个性化预测,每个对应支持集中观察到的一种标注者风格,而不是单一共识分割。 此前的少样本医学图像分割方法通常假设每张图像只有一个可靠标注,而多标注者分割研究多在标注充足的完全监督设定下进行;该工作把标注稀缺与标注异质两个现实条件放在同一设定中。 该贡献以问题形式化与协议定义呈现,论文在方法部分给出支持集与查询集在R个标注者下的具体记号,并在N=K=1的既有少样本协议下展开。
论文提出JAPC(联合注意力原型校准)模块:以共识原型与各标注者原型之差作为偏差,令查询来自拼接后的标注者原型、键来自偏差、值为原型,通过共享自注意力得到校准原型,再与查询特征做余弦相似度预测;该模块不修改骨干特征提取器,可插入任意基于原型的少样本分割方法。 相对“逐标注者独立处理”的朴素基线,该设计让每个标注者原型能够关注其他标注者的偏差,从而显式建模共享语义与各标注者特有的边界倾向,而不是把标注差异当作随机噪声。 论文给出注意力计算式与校准损失Lcalib(各标注者原型与校准原型之差的平方和均值),并在Abd-CT设置2的消融中显示注意力与两阶段训练带来进一步提升,全部模块组合取得最佳总体结果。
论文引入伪风格生成与两阶段训练:由超像素伪标签经随机结构化边界变换(如膨胀/腐蚀)合成R个风格变体,仅用于训练时的支持标签与查询监督;训练总预算T的前T/2迭代先训练基础原型模型,之后启用JAPC与伪风格继续训练。 超像素伪标签本身与风格无关,缺少标注者特定变化;伪风格生成在保留伪监督的同时提供多风格监督,两阶段安排则针对随机初始化编码器下校准模块的原型动态不稳定问题。 消融显示伪风格监督带来小幅提升,注意力与两阶段训练进一步提升,校准损失显著增强原型正则化;实现细节说明Abd-CT共50k迭代、本方法从25k检查点初始化,Brain-MRI共10k迭代、从5k开始。
在两个多标注者基准上,方法在逐标注者Dice上一致优于少样本与多标注者基线,且提升跨标注者稳定。 论文报告Abd-CT设置1中SSL-ALPNet由61.48提升至62.79、DSPNet由61.52提升至62.25,Brain-MRI上DSPNet由54.02提升至66.62;设置2中SSL-ALPNet由56.58提升至58.69、DSPNet由58.11提升至59.62,逐标注者宏平均Dice亦同步上升。 所有少样本方法使用相同的支持—查询划分与同一DeepLabv3-ResNet101骨干,并纳入完全监督模型作为上界;论文同时报告逐类别、逐标注者与定性结果,并指出胰腺上仍可能落后于受益于区域级约束的超体素方法。
启示与展望
该工作面向的是支持集同时包含多个标注者掩膜、且需要按标注者风格输出个性化预测的少样本医学分割场景,适用于腹部CT多器官与脑MRI单类别这类多标注者数据;由于JAPC不修改骨干特征提取器,它可以直接叠加到已有的基于原型的少样本分割流程上,为后续研究提供可插拔的个人化组件与逐标注者评估基线。对读者而言,这意味着在标注者风格差异具有结构性的任务中,把差异显式建模在原型空间比合并为共识或逐标注者独立训练更值得尝试。
论文在Abd-CT设置2的消融中,加入伪风格后胰腺Dice由35.32降至34.21,而全模块组合为36.78,说明各组件在不同器官上的作用并不一致,读者需要关注这种类别间差异。论文也指出胰腺性能仍可能落后于受益于区域级约束的超体素方法,伪风格监督虽减少碎片化但未总能消除差距。此外,Brain-MRI因官方测试集不可用而以验证集评估,仅5例测试扫描,且只有一个类别,因此其提升幅度在更大多标注者队列上的可重复性仍是开放问题。
