跳到主要内容
返回时间线
arXiv来源发表:

DA-SAM3 用双自适应低秩专家路由,在四个公开医学分割基准上以超过 80% 的 MoE 参数削减取得约 5% 的精度提升

核心概要

该工作提出 Dual-Adaptive SAM3(DA-SAM3),在 SAM3 的融合模块中把部分前馈网络替换为双自适应 MoE 层:任务侧用 Dynamic Expert Router(DER)同时依据视觉内容与文本概念提示稀疏激活专家,参数侧用 Decomposed Parameterized Experts(DPE)把每个专家表示为继承自预训练 SAM3 的共享冻结基座加轻量低秩增量,从而在 Synapse CT、MMWHS、BTCV、ACDC 四个公开数据集上匹配或超过全量微调 SAM3 与标准 MoE 基线,并相对当时最先进方法取得约 5% 的提升,同时把 MoE 参数开销降低 80% 以上。

Source-provided article image: Dual-Adaptive SAM3: Hierarchical Routing over Low-Rank Expert Layers for Parameter-Efficient Medical Image Segmentation
Fig. 1

Fig. 1. (a) The architecture of the Dual-Adaptive SAM3 framework. (b) The architec- ture of trainable Transformer. (c) The Dual-Adaptive MoE Layer including Dynamic Expert Router (DER) and Decomposed Parameterized Expert (DPE)

· 第 3 页

深度剖析

提出 DA-SAM3 框架,把动态多模态路由与参数高效专家分解结合,用于把概念条件化的视觉语言基础模型适配到医学图像分割。 作者称这是首个把动态多模态路由与参数高效专家分解整合起来、用于视觉语言基础模型医学适配的框架,区别于静态且均匀施加的 LoRA/Adapter 以及开销较大的常规 MoE。 论文给出完整方法描述(DER、DPE、分层放置与两阶段训练),并在四个公开数据集上给出对比与消融结果;证据来自作者自报的实验表格与可视化,未包含外部复现。

Dynamic Expert Router(DER)以全局域上下文向量与局部 token 特征为条件,对每个 token 稀疏选择 top-k 专家(k=2),并用 StopGrad 保护冻结的概念嵌入。 相对随机路由或简单拼接视觉与文本 token,DER 让路由显式利用临床概念嵌入来激活任务相关专家;消融中把 DER 换成随机路由后性能明显下降。 消融表显示随机路由在 Synapse CT 上 DSC 为 82.75、HD 为 12.120,而完整模型为 85.12 与 8.425;该对比支持路由机制的作用,但仅限作者设定的实验条件。

Decomposed Parameterized Experts(DPE)把每个专家写成共享冻结的预训练 FFN 权重 W0 加低秩增量 ΔW=AB^T,使 MoE 参数开销降低 80% 以上。 相比把专家实现为完整稠密网络,DPE 复用预训练权重作为共享基座,只训练低秩增量,从而在保持专家特化的同时大幅压缩新增参数。 论文在摘要与引言中报告参数开销降低超过 80%,消融中移除 DPE(改用完整专家)在三个数据集的所有指标上均变差,作者将其解释为参数分解起到正则化作用。

分层放置与两阶段训练让不同深度的专家分别承担粗对齐、语义识别与边界细化,并在四个公开基准上取得领先结果。 DA-SAM3 只在 {L/6, L/4, L/2} 三个深度替换 FFN,并采用先专家特化、后路由校准的两阶段策略,作者将其类比为放射科医生的由粗到细阅片流程。 表 1 中 DA-SAM3 在 Synapse CT 得 DSC 85.12、HD 8.425,MMWHS 得 90.06、12.880,BTCV 得 77.35、5.587,ACDC 得 91.93、1.064;消融显示完整模型在 Synapse CT 上比 SAM3 基线 DSC 提升 4.37%。

启示与展望

该工作面向需要在资源受限条件下把概念条件化分割模型适配到医学影像的研究者与工程团队,适用场景是心脏与腹部 CT/MRI 的多器官与多结构分割,且沿用四个公开数据集的官方划分以便与既有工作比较。方法层面,它给出了一条可复用的路径:在融合模块的特定深度替换前馈网络,用视觉与文本联合信号驱动稀疏路由,并用共享冻结基座加低秩增量承载专家参数。对读者而言,这意味着后续工作可以在此基础上探索替换位置、专家数量与路由输入的设计空间,而不必从全量微调起步。

论文报告了参数开销降低超过 80% 与约 5% 的精度提升,但未在正文中给出可训练参数量的绝对数值、推理时延或显存占用的实测数据,因此效率收益的具体量级仍需读者结合代码仓库确认。消融实验覆盖 Synapse CT、MMWHS 与 ACDC 三个数据集,BTCV 未出现在消融表中,分层放置位置 {L/6, L/4, L/2} 与专家数量 4、top-k 为 2 的选择依据主要来自经验设定,其敏感性尚待进一步观察。此外,实验集中在心脏与腹部 CT/MRI,其他模态与病理类型上的表现属于开放问题;文中提到“可解释结果”但正文未展开具体形式,读者若关心可解释性需要查阅图 2 与代码。

来源