HD-TTA 用「压缩还是膨胀」的竞争假设选择,在跨域脑肿瘤分割中把 HD95 降低约 6.4 mm、精度提升超 4%
核心概要
该工作提出假设驱动的测试时自适应框架 HD-TTA:在冻结 nnU-Net v2 主干、仅优化测试样本 logits 的前提下,先用 Gatekeeper 判断样本是否需要修正,再并行生成「压缩去噪」与「膨胀恢复」两个几何假设,并用基于纹理一致性的表示引导选择器挑选最安全结果;在 BraTS 2023 GLI 上训练、在儿科 PED 与脑膜瘤 MEN 两个未见目标域上以固定超参数评估,HD-TTA 在保持 Dice 相当的同时改善了安全性指标,在 MEN 上相对最强基线 TCA 将 HD95 从 70.96 mm 降至 64.55 mm(约 6.4 mm),精度从 15.36% 提升至 19.64%。
Fig. 1. Comparison of Standard TTA versus our proposed HD-TTA framework.
· 第 2 页深度剖析
把测试时自适应从「对所有或过滤后样本施加统一目标的盲目优化」改写为动态决策过程:先判断是否需要修正,再在竞争假设之间选择。 以往 TTA 方法(如熵最小化、自训练、特征统计对齐)通常对每个或过滤后的测试样本套用同一目标;HD-TTA 显式引入「是否修正」与「修正方向」两个决策环节。 论文以方法描述与消融实验支撑:去掉 Gatekeeper 后 Dice 降至 85.38%、HD95 升至 6.19 mm,说明选择性修正对稳定域有实际作用。
提出两个几何意义明确的竞争假设:Hcompact 用熵、全变分与「重力损失」把离群像素拉向肿瘤质心以去噪;Hdiffuse 用测地线屏障约束的膨胀项恢复被漏掉的组织。 相比固定策略或依赖交互点击的分治框架,这里用可替换的代理损失实例化同一框架,且膨胀被图像梯度导出的测地线屏障限制在解剖边界内。 消融显示强制只用 Hdiffuse 在稳定域上 HD95 升至 9.31 mm,而完整 HD-TTA 收敛到 Hcompact 的 5.35 mm,说明选择器能拒绝不安全的膨胀。
用仅依赖测试样本的纹理一致性信号(Srep,比较膨胀新增区域与高置信肿瘤核心的强度分布)无监督地选择假设,并以 Hcompact 为安全默认。 选择器不需要真值标签,只在新招募像素与核心强度特征一致(Srep > 0.95)时才采纳膨胀,否则回退到压缩。 论文将其定位为概念验证选择器,并说明可替换为基于扰动稳定性或形态学的选择器;定量证据来自表 1 与表 2 的对比。
在跨域二分类脑肿瘤分割上验证:源模型在 BraTS 2023 GLI(1251 例)训练,目标域为 99 例 PED 与 144 例 MEN,超参数全程固定不做目标域调参。 与多数需要目标域调参或交互输入的方案不同,这里强调开箱即用的跨域稳健性,并聚焦 HD95 与 Precision 这类安全指标而非仅看 Dice。 PED 上 HD95 5.35 mm(较 TCA 的 6.39 mm 改善 16.3%)、Precision 86.32%;MEN 上 HD95 64.55 mm、Precision 19.64%,均标注 p < 0.05 的显著性。
启示与展望
该结果面向无目标标签、存在分布偏移的医学图像分割场景,尤其是需要控制边界风险与假阳性的安全关键任务。它使后续工作可以在不改动主干权重的前提下,把「选择性修正 + 竞争假设 + 无监督选择」作为可插拔的推理层,用于儿科与脑膜瘤等与训练队列不同的目标域,也可替换其中的代理损失与选择器。作者说明该框架可扩展到多类或其它结构化预测任务,但本文的验证范围是二分类全肿瘤掩膜。
读者仍需留意:本文自述为概念验证,MEN 上所有方法的 Dice 都偏低,说明该目标域本身极难;各方法标准差普遍较大,作者也将其归因于目标队列的内在异质性。选择器被描述为概念验证,可替换为扰动稳定性或形态学方案,其替换后的表现尚待观察。此外,HD-TTA 在边界样本上每个假设需 1000 步 logit 优化,报告的平均额外延迟约为每例 21.9 秒,Gatekeeper 在 PED 与 MEN 上分别标记约 23.6% 与 99.3% 的病例,因此实际开销随目标域差异很大。TEGDA 在本文配置下输出掩膜与 Classic TTA 相同,作者将其解释为更新未进入生成保存预测的推理图,这一现象的具体原因仍是开放问题。
