SurgDepth:面向手术场景理解的深度基础模型测试时自适应
核心概要
该工作提出 SurgDepth,一种无需任何标注手术数据的测试时自适应框架,通过立体光度一致性与翻转等变性两种自监督信号、选择性解码器自适应以及进度感知锚点正则化和低照度序列结构信任保护两项免调参可靠性机制,将自然图像预训练的深度基础模型适配到内窥镜手术场景;作者报告在立体图像对上 AbsRel 最多降低 63%、无立体时降低 42%,在五个跨域评测设置中改善四个,跨七种基础模型泛化,并在完整标准 Hamlyn 基准上取得所报告方法中最低的 AbsRel(0.128),所有结果均为中值缩放后的相对深度,20 步收敛(0.4 秒)。
深度剖析
提出无需标注手术数据的测试时自适应框架 SurgDepth,用立体光度一致性和仅需单图的翻转等变性作为自监督信号,并配合选择性解码器自适应。 既有适配方法需要针对每个新相机和临床环境采集手术训练数据,而该框架在测试时直接适配,不依赖标注手术数据。 论文以摘要形式给出框架设计与两类自监督信号,并报告在立体与非立体两种设定下的 AbsRel 降幅(最多 63% 与 42%)。
引入两项免调参可靠性机制:进度感知锚点正则化与面向低照度序列的结构信任保护。 这两项机制针对测试时自适应在手术场景中的稳定性问题,且不需要额外超参数调优。 论文在摘要中说明机制的作用对象(低照度序列)与免调参属性,具体消融细节未在摘要中展开。
完成首个针对稠密深度回归的测试时自适应系统性研究,比较八个基线方法,发现现有 TTA 方法在该设定下持续失败。 此前缺少对 TTA 用于稠密深度回归的系统性考察;该研究指出基于熵的方法无论适配多少参数都会退化,时序光度自适应在非刚性组织上发散。 结论来自对八个基线的系统比较,属于该设定下的方法学观察。
在跨域评测中改善五个设置中的四个(四个未见数据集中三个;Hamlyn 按两种协议评测),跨七种基础模型泛化,并在完整标准 Hamlyn 基准上取得所报告方法中最低 AbsRel(0.128)。 把适配效果从单一模型、单一数据集扩展到多模型与多数据集,并在标准基准上给出可比数值。 结果基于跨域评测与标准基准比较,且明确限定为相对(中值缩放)深度;20 步收敛(0.4 秒)支持其时效性。
启示与展望
该结果面向需要相对(中值缩放)深度的手术内窥镜应用,例如增强现实叠加与重建初始化;适配在测试时进行,不需要标注手术数据,可作用于立体图像对或仅单图,并已在七种基础模型与多个跨域设置上验证。对于依赖绝对尺度深度的任务,其适用性取决于后续工作如何把相对深度与尺度信息结合。
当前可依据的文本为摘要,未包含图表、逐数据集结果与消融实验,因此两项可靠性机制各自的贡献比例、八个基线失败的具体条件、以及 Hamlyn 两种评测协议之间的差异仍需在正文中确认;此外所有结果均为中值缩放的相对深度,绝对尺度深度下的表现是开放问题。
