跳到主要内容
返回时间线
arXiv来源发表:

UltraWorld 用未追踪临床超声视频自蒸馏出可交互世界模型,在九个仿真闭环规划回合中把终点距离与朝向误差较视觉伺服降低 29% 与 38%

核心概要

UltraWorld 提出一种自蒸馏方案:先把临床超声视频适配成以参考图像和解剖掩膜为条件的超声生成器,再用三维解剖沿可编程轨迹采样掩膜合成动作—视频对,将生成器蒸馏为仅凭局部观测与动作预测未来观测的世界模型,并引入把探头位姿与成像设置表示为逐像素三维采样位置、声束方向与深度的 Acoustic Sampling Map;实验显示预测保真度与动作跟随改善,在九个仿真闭环局部规划回合中终点距离与朝向误差较视觉伺服分别降低 29% 与 38%。

Source-provided article image: UltraWorld: Learning Interactive Ultrasound World Models from Untracked Clinical Videos with Acoustic Sampling Map
Figure 1 ·

Figure 1: Learning ultrasound world models from untracked clinical videos. (a) Clinical videos provide appearance priors, while 3D anatomy provides motion supervision. Together, they yield synthetic action–video pairs for self-distillation. (b) Complex scanning operations change which anatomical cross-sections are imaged and how they are sampled. AsMap encodes the resulting sampling positions, beam directions, and depths to support reliable action control.

arXiv

深度剖析

提出从无动作标注的临床超声视频学习动作条件世界模型的自蒸馏配方:先学习以参考图像与解剖掩膜为条件的可控超声视频先验,再用三维解剖沿可编程轨迹(扫查、滑动、摆动、回访、改变成像深度或视野)采样掩膜,合成与采集状态天然配对的视频—动作对,最后把生成器蒸馏为以局部观测和动作为输入的世界模型。 既有超声世界模型依赖同步的超声—位姿记录来学习采集动力学,而临床常规录像通常没有探头运动记录;该工作把动作监督从真实配对中解耦,改由三维解剖资产与可编程轨迹独立构造,从而可利用未追踪的临床视频。 在 BUV 与 CAMUS 上学习掩膜条件视频先验,在 I-SPY1 体数据上构造解剖引导轨迹;数据按患者划分,派生片段保留在源患者分区内。

提出 Acoustic Sampling Map(AsMap),把探头位姿与成像设置表示为逐像素的三维采样位置、单位声束方向与采样深度,并以首帧探头坐标系表达,使条件信号在探头位姿不变而仅改变成像深度或视野时仍发生变化。 位姿条件无法区分成像尺度变化,相机类编码描述的是视射线或投影关系,而 B 模式像素对应沿声束的深度定位采样;AsMap 把这一采样几何显式化,并在首个 transformer 块之前一次性加到视频 token 上,不修改内部结构。 在相同采集状态下与 Fourier 编码、MLP 编码和 PRoPE 比较,AsMap 在 PSNR 24.994、LPIPS 0.236、latent 0.095、四帧 LPIPS 0.466、运动误差 4.155 上均为最优;参数匹配的 MLP(53.49M,与 AsMap 的 53.48M 相当)仍较差,说明增益不能由编码器容量或坐标约定解释。

验证掩膜条件生成器在保持真实超声外观的同时跟随指定解剖结构,并展示世界模型可用于仿真中的目标导向局部规划。 把生成先验与动作条件预测连接起来,并进一步用于模型预测控制加交叉熵方法的闭环规划,与基于强度的视觉伺服基线比较。 生成视频 SSIM 0.4265、LPIPS 0.4071,分割平均 IoU 0.8736,生成病灶与条件掩膜的 Dice 0.9260(真值分割与同一掩膜为 0.9538);九个仿真回合中终点平移与旋转误差低于视觉伺服。

在未见真实临床帧上评估一致性:以患者留出的 BUV 与独立 BUSI 图像作为初始观测,在零动作与往返轨迹下用 LPIPS 衡量稳定性与回归一致性。 在缺少配对临床未来帧的条件下,提供一种不依赖真值未来的动作敏感性检验方式。 AsMap 在两个数据集上零动作与往返 LPIPS 均为最低(BUSI 0.042 与 0.062,BUV 0.059 与 0.076);论文明确指出往返一致性本身不足以确立动作跟随精度。

启示与展望

该工作面向希望利用常规临床超声录像训练动作条件预测的研究者与工程团队,适用于具备三维解剖资产以构造可编程扫描轨迹、并可在仿真中做闭环规划评估的场景。方法在推理时不需要解剖掩膜或三维资产,因此部署侧只需局部观测与采集状态。论文指出后续将用少量带追踪的临床数据做校准与验证,并扩展到更广的解剖与设备域以及物理机器人系统。

世界模型主要用生成器合成的动作—视频轨迹训练,而非带同步探头追踪的真实超声序列,生成先验中的误差或偏置可能传递到蒸馏后的世界模型。AsMap 表示采集几何,但不显式建模组织相关的散射、衰减与斑点形成,其度量解释依赖探头位姿与成像几何已标定。真实临床超声评估因缺少已知动作的配对未来观测,只能考察稳定性与往返一致性;闭环机器人规划目前仅在仿真中、且回合数有限。此外,正文中若干公式与部分表格数值在解析文本中不完整,若需复现具体数值与超参数,应查阅原文附录。

来源