RPG-SAM 用可靠性加权原型与几何自适应阈值,在 Kvasir 上把免训练单样本息肉分割 mIoU 提升 5.56%
核心概要
该工作提出 RPG-SAM,一个基于 SAM2 的免训练单样本息肉分割框架,用可靠性加权原型挖掘(RWPM)按对比因子与反向纯度因子加权支持图像的前景原型并以背景原型作负锚点抑制噪声,用几何自适应阈值选择(GAS)依据形态实心度与尺度一致性动态挑选二值化阈值,再用先验引导迭代精炼(PIR)循环修正边界,在 Kvasir 上取得 78.65% mIoU 与 85.65% mDice,较 ProtoSAM 分别提升 5.56% 与 4.11%,并在 PolypGen 三中心、CVC-ClinicDB、CVC-ColonDB 上报告了对比结果。
Fig. 1: Motivation of RPG-SAM. (a) Regional and Contextual Heterogeneity. Top: The varying regional utility of the support foreground means that de- graded areas (e.g., reflection d) trigger false-positive noise in query images. Bot- tom: Treating the contextual background as a distinct information layer provides negative anchors to effectively suppress heatmap activations. (b) Intensity Het- erogeneity. The histogram of optimal binarization thresholds across the Kvasir dataset [8] highlights the stochastic response intensities of different query scenar- ios, exposing the limitations of fixed-threshold (homogeneous) sampling rules.
· 第 2 页深度剖析
提出 RWPM,用对比因子 Ck 与反向纯度因子 Rk 的乘积 Wk 对 SLIC 超像素前景原型加权,并把背景原型作为负锚点从热图中减去,以抑制镜面反射等退化区域引发的假阳性。 此前 PerSAM、Matcher、OPSAM、ProtoSAM 等匹配式提示采样流程把支持前景像素视为同等代表、且多不把支持背景当作独立信息层;该工作显式区分原型可靠性与背景对比参考。 消融显示仅加入背景抑制即在 Kvasir 上带来 3.78% mDice 增益,再叠加 RWPM 后 mIoU 从 67.89% 升至 71.27%、mDice 从 78.72% 升至 81.05%。
提出 GAS,在阈值区间内扫描生成候选掩膜,按加权实心度与尺度一致性组成的几何分数 Sgeo 选出最优先验掩膜,替代固定阈值。 固定阈值或区域统计的二值化规则无法适应不同查询图像响应强度的随机性;GAS 以形态先验动态重校准阈值。 消融中 GAS 相比最优固定阈值(τ=0.7)提升 2.59% mDice;超参分析显示扫描范围 [0.4, 0.7] 给出最佳候选池,更低范围引入噪声、更高范围限制多样性。
提出 PIR,以几何先验掩膜为参照,按覆盖率与 IoU 判断误差类型,用欧氏距离变换取假阴性区域中心作正提示、取假阳性区域作负提示,迭代调用 SAM2 精修边界。 把 SAM2 的边界精修能力接入自动化循环,无需人工干预,并以迭代历史中相对先验 IoU 最高的掩膜作为最终预测。 消融中在 BG Supp.、RWPM、GAS 基础上加入 PIR 后,Kvasir 上 mIoU 从 75.25% 升至 78.65%、mDice 从 83.64% 升至 85.65%;PIR 阈值 τcov=0.9、τiou=0.8 时结果最优。
在四个公开数据集上验证整体性能,Kvasir 达 78.65% mIoU / 85.65% mDice,PolypGen 三中心分别为 59.45/64.78、61.04/67.14、76.75/83.56,CVC-ClinicDB 为 70.18/77.76,CVC-ColonDB 为 61.16/68.77。 与 SEGIC、PerSAM、Matcher、OPSAM、ProtoSAM 在相同支持-查询对与骨干设置下比较,RPG-SAM 在报告的各数据集上均取得最高数值。 所有推理在单张 NVIDIA RTX 3090 上完成,无任何训练或微调;使用 DINOv2 ViT-L/14(560×560)作特征编码器、SAM2(1024×1024)作掩膜生成器。
启示与展望
该框架面向标签稀缺的临床场景,用单张带标注支持图像驱动查询图像分割,适用于内窥镜息肉图像;方法以 DINOv2 特征与 SAM2 掩膜生成器为基础,在单张 RTX 3090 上完成全部推理,无需训练或微调。作者指出后续工作将把该框架扩展到利用内窥镜视频的时间一致性,说明当前结果针对的是静态图像设定。
消融与超参分析集中在 Kvasir 单一数据集上,其他数据集只报告了最终对比数值,因此各模块在跨中心场景中的独立贡献仍需读者自行判断。GAS 依赖参考面积 Aref 表示息肉期望中位尺度,该量如何设定在正文中未展开。此外,代码标注为“将发布”,当前无法核对实现细节;若读者需要复现,需关注这一开放项。
