跳到主要内容
返回时间线
arXiv来源发表:

VA-Adapter 让超声基础模型学会心脏探头导航,训练参数减少约33倍且误差低于强基线

核心概要

该工作提出 Vision-Action Adapter(VA-Adapter),将其插入超声基础模型(EchoCLIP、USFM、BiomedCLIP)冻结的图像编码器深层,通过编码历史“图像-动作”序列在线注入个体三维心脏结构理解能力,在178名成人、356条专家扫描轨迹、131万图像-动作对的数据集上,以约2.61M–3.97M可训练参数取得优于强探头导航基线的平移与旋转平均绝对误差。

AI-generated editorial illustration: VA-Adapter: Adapting Ultrasound Foundation Model to Echocardiography Probe Guidance

深度剖析

提出 VA-Adapter,把探头导航建模为视觉-动作序列交互,并嵌入基础模型图像编码器深层,使模型能从历史帧与相对位姿中推断个体心脏解剖结构。 以往探头导航工作与诊断基础模型相互独立,且序列基线通常只在预测头融合图像与动作特征;该工作首次把诊断基础模型的图像表征与序列化的视觉-动作交互结合,在特征提取过程中逐步学习结构。 在131万图像-动作对数据集上,EchoCLIP+Ours 以2.61M可训练参数取得平移5.40 mm、旋转6.74°的平均MAE,优于全量微调的 EchoCLIP(6.56 mm、7.66°)等基线。

在参数效率上显著优于全量微调与其他PEFT方法(LoRA、Prefix Tuning),并保持实时推理。 相比全量微调基线,可训练参数减少约33倍(如 EchoCLIP 88.41M 对 2.61M);消融显示适配器维度 r=8 时仅0.2M参数(全量微调的0.23%)即可降低MAE 11.9%/8.2%。 表1给出各基线的可训练参数与MAE;RTX 3090 上单序列推理约10.0–11.1 ms(无VA-Adapter)与10.5–11.8 ms(有VA-Adapter)。

视觉-动作交互模块是性能提升的关键来源,而非单纯增加参数。 与去掉交互模块的 vanilla adapter 相比,在仅多0.9M参数的情况下,平移/旋转MAE分别降低12.6%/8.0%,且第一个epoch后即优于其他方法。 基于 EchoCLIP 的七种训练基线消融对比(Fig. 4)与适配器维度消融(Fig. 5)。

模型对心脏周期变化与非标准、低质量平面具有鲁棒性,可从视觉-动作关系推断正确动作。 同一探头位置、不同心脏时相(收缩期/舒张期)的帧输出一致;对缺乏明显视觉特征的非标准平面,序列模型仍能给出正确动作,而单帧模型无法做到。 Fig. 6 的可视化:应用预测动作得到位姿后在扫描序列中最近邻检索,检索平面与目标平面一致。

启示与展望

该结果面向成人经胸心脏超声的10个标准平面导航,数据来自178名成人受试者、356条由两位资深超声医师采集的专家扫描轨迹,使用GE机器与M5S探头,在伦理委员会批准与监督下采集;训练用284条扫描、验证用72条,且两组受试者不同。方法适用于已具备图像编码器的超声基础模型(EchoCLIP、USFM、BiomedCLIP),在冻结主干的前提下以适配器形式接入,因此适合希望低成本复用现有基础模型、并具备带位姿标注扫描序列的场景,例如为初级超声医师提供实时辅助或作为自主机器人超声系统的决策核心。

验证集来自与训练集不同的受试者,但规模为72条扫描,跨中心、跨设备与跨人群的泛化仍需更多数据检验;数据集仅覆盖成人经胸10个标准平面,胎儿、儿科或经食管场景是否适用尚不明确;可视化以最近邻检索平面与目标平面比对来展示导航效果,未在文中给出闭环机器人执行的临床终点;文中未报告推理延迟之外的失败模式统计,实际部署中遇到严重解剖变异或极差图像质量时的表现仍是开放问题。

来源