SCISSR 用涂鸦提示替代点与框:在 EndoVis 2018 达 95.41% Dice、跨域 CholecSeg8k 达 96.30% Dice
核心概要
该工作提出 SCISSR,一个以手绘涂鸦为提示的交互式手术场景分割框架:它用一个轻量 Scribble Encoder 把涂鸦转成与掩码解码器兼容的稠密提示嵌入,配合 Spatial Gated Fusion 与可开关 LoRA 适配器,在冻结 SAM 2 主干的前提下支持多轮纠错,在 EndoVis 2018 上五轮交互达到 95.41% Dice,在未参与训练的 CholecSeg8k 上三轮达到 96.30% Dice,均优于迭代式点提示。
深度剖析
提出轻量 Scribble Encoder,把自由手绘涂鸦映射为稠密提示嵌入,使涂鸦可直接接入掩码解码器并支持逐轮纠错。 此前交互式方法以点击为主,手术场景中的 SAM/SAM 2 适配也大多保留点/框提示;ScribblePrompt 主要面向强度归一化的生物医学图像且未利用 SAM 2 的记忆库,其他工作仅把涂鸦当作弱监督。 方法层面给出编码器结构(缩放到 256×256、两层 stride-2 卷积块加 1×1 投影到 D=256,输出 256×64×64 嵌入),并在 EndoVis 2018 与 CholecSeg8k 上以固定轮次自动协议评测。
设计双轨涂鸦通路与记忆驱动的迭代细化:Track 1 累积全部涂鸦作为稠密提示,Track 2 只把最新纠正经 Spatial Gated Fusion 注入 Memory Attention 查询,记忆库仅保留上一轮特征。 把 SAM 2 原本用于视频时序的记忆机制改用于单张图像上的多轮交互纠错,并用零初始化的可学习标量 α 使 SGF 在训练开始时等价于恒等映射。 消融显示在 EndoVis 2018 上加入 SGF 后 R2 mIoU 由 80.21% 升至 83.59%,再加入 Memory 升至 88.30%;逐类消融中 Wrist 的 R2 IoU 增益为 +14.20。
架构无关的模块化设计:Scribble Encoder、SGF 与 LoRA 适配器只通过标准嵌入接口与主干交互,因此可迁移到 SAM 3 等提示驱动架构而无需结构改动,且 LoRA 可开关以保留标准视频传播能力。 相较绑定单一主干的改造方案,这里把新增能力限定在轻量附加模块上,主干保持冻结。 论文以 SAM 2 Tiny 为实例,LoRA 秩 r=8、缩放 α/r=2,插入掩码解码器与 Memory Attention 的 query/value 投影;图像编码器完全冻结。文中说明可迁移到 SAM 3,但未给出 SAM 3 上的实测结果。
在分布内与分布外两个腹腔镜数据集上验证涂鸦提示优于点与框:EndoVis 2018 上 contour 策略 R4 达 91.60% mIoU / 95.41% mDice,CholecSeg8k 上 adaptive 策略 R2 达 92.30% mIoU / 95.82% mDice。 点提示基线在轮次增加时往往退化(如 SAM3 1pt/CC 在 CholecSeg8k 上 R0 56.74% mIoU 降至 R2 52.62%),而涂鸦策略逐轮稳定提升;框与监督基线不支持迭代细化。 EndoVis 2018 测试样本 4,616、CholecSeg8k 测试样本 8,800;收敛效率上 SCISSR 在 Dice≥0.75 时成功率 99.0%、平均 1.37 轮,点基线为 75.5% / 1.51 轮;点密度分析显示 SAM 2 Tiny 与 SAM 3 均在每通道 10 点达到峰值,30 点与 50 点后急剧下降。
启示与展望
该结果面向腹腔镜手术场景的交互式标注与分割,适用于以 SAM 2 类提示驱动分割模型为基座、允许用户逐轮绘制纠正笔画的设置;作者指出后续将扩展到视频级标注并用真人标注者验证可用性。方法在 EndoVis 2018 上训练,CholecSeg8k 仅用于分布外测试,因此跨域结论限于这两个数据集所覆盖的术式与类别体系。
评测采用自动协议,由真值掩码合成初始涂鸦与纠正笔画,而非真人操作,因此实际标注效率与用户体验仍待验证。涂鸦由四种策略合成(centerline、wave skeleton、contour、line),其中 contour 在各轮表现最好而 centerline 落后,说明结果对涂鸦形态敏感。点密度分析仅在 CholecSeg8k 的 4 个视频子集上进行。此外,文中提到可迁移到 SAM 3,但未报告 SAM 3 上的实测结果;Cystic Duct 在 CholecSeg8k 中仅 1 个样本,其逐类数字的稳定性有限。
