MyoSTAT.AI:面向合成数据上时间分割与剪切波速度稳定化的可复现基准测试工具包
核心概要
该研究构建了 MyoSTAT.AI,一个完全在合成数据上运行、确定性可复现的心脏超声分割与剪切波弹性成像(SWE)速度场稳定化基准框架,通过单变量消融比较四种 U-Net 系架构(2D、2.5D、3D、ConvLSTM)并评估六种稳定化方法,报告 ConvLSTM 分割精度最高(Dice 0.994、IoU 0.987,较 2D 基线 Dice 0.808 提升 18.6 个百分点)、UNet2.5D 在 3 帧时间窗下以更低延迟(433 ms 对 1193 ms)达到 Dice 0.983、TensorRT FP16 部署在 RTX 3060 与 Jetson Orin Nano 上分别达到 341 FPS 与 90.4 FPS,以及 smoothn 惩罚最小二乘稳定
Figure 1. MyoStat.AI pipeline overview. From cine ultrasound input through preprocessing,
medRxiv · 第 16 页深度剖析
在合成参考语料上,时间建模架构的分割精度高于单帧基线:ConvLSTM 达到 Dice 0.994、IoU 0.987,UNet3D 为 Dice 0.988、IoU 0.977,UNet2.5D 为 Dice 0.983、IoU 0.967,而 UNet2D 基线为 Dice 0.808、IoU 0.678。 相对既有以临床标注数据集(如 CAMUS、EchoNet-Dynamic)评估分割的工作,本文把 2D 到时间维度的四种 U-Net 系架构放在同一合成基准与同一消融协议下比较,并同时报告 Dice、IoU 与逐帧延迟。 结果来自合成参考语料(分割语料 1,200 帧、SWE 语料 900 个速度场案例)上的单次运行;作者明确说明未做重复运行统计或假设检验,因此排序应视为描述性结果。
时间上下文对分割有帮助,但其编码方式影响结果:单帧输入弱于所有多帧变体,而 UNet2.5D 的堆叠通道编码在 3 帧窗口达到峰值(Dice 0.984,较单帧 +0.064),随后在 5 帧(0.976)和 7 帧(0.956)单调下降。 该工作把时间窗长度作为独立消融轴,量化了堆叠通道表示随窗口延长的退化趋势,并将其记录为失败模式 FM-001(时间上下文回归)。 基于 17 个变体的单变量隔离消融,消融语料为 64 个合成样本、每次运行前以 global_seed = 42 重新生成,训练为 20 个梯度步的快速迷你训练。
在合成速度场上,惩罚最小二乘时间稳定化(smoothn,λ ∈ {5, 10, 20})将剪切波速度的时间 CoV 从 81.07 降至 29.37,即 63.8% 的改善,且三个 λ 值之间无实质差异,边缘保持分数均为 1.000。 相对未稳定化基线与两种 SNR 自适应窗口方法,该结果给出了稳定化预设之间的方法间比较:adaptive_coarse 虽将 CoV 降至 6.04(92.6%),但平均速度从 3.11 降至 0.90 m/s、边缘保持降至 0.317;adaptive_fine 反而将 CoV 升至 130.67。 评估在固定随机种子生成的合成速度场上进行,稳定化配置为 30 Hz、25 帧窗口;作者指出这些是受控条件下的方法间比较,而非体内性能的绝对预测。
部署与可复现性工程:由同一导出 ONNX 模型编译的 TensorRT FP16 引擎在 RTX 3060 上达到 341 FPS、在 Jetson Orin Nano 上达到 90.4 FPS;Jetson 上 8 次独立基准运行的跨运行 CoV 为 0.174%,平均推理延迟 11.062 ms(±0.019 ms),p95 低于 11.13 ms。 该工作提供了带版本化配置、数据集清单 SHA-256 校验与证据包(含配置文件、逐变体指标与校验和)的基准测试框架,并记录了七类工程失败模式(FM-001 至 FM-007)及其量化证据与缓解策略。 8 次运行均通过清单校验;作者说明该流程只衡量已训练固定配置的计时重复性,不评估训练本身或精度指标在不同初始化下的可复现性。
启示与展望
该工作面向的是合成域内的计算基准:分割任务定义为从合成心脏超声 cine 帧预测二值目标区域掩膜,SWE 分支在合成速度场上估计剪切波速度,激励源与采集物理未被建模。它适用于需要可复现基线、硬件特定推理可行性参考与失败模式清单的工程与研究场景,例如在 RTX 3060 工作站与 Jetson Orin Nano 嵌入式平台上比较时间分割架构与稳定化预设。作者明确说明这是合成概念验证,而非经过验证的临床或操作者无关工具,真实超声心动图数据采集与临床验证是任何诊断或部署就绪声明的前提。
训练与评估掩膜由同一合成生成器产生,因此 Dice、IoU 与 CoV 反映的是与生成器自身几何的内部一致性,而非独立验证的解剖准确性;真实超声心动图中的组织异质性、操作者差异与采集伪影尚未评估。精度排序来自单次运行,损失函数、dropout 与增强的结果各来自每个变体一次 20 梯度步运行且采用逐变体而非匹配种子,因此真实效应尚不能与运行间方差区分,相关机制解释(梯度稀疏、权重冗余、分布偏移)是待检验假设。计时重复性仅在单一序列化引擎、单一硬件单元上评估,未检验对初始化、硬件或站点的敏感性;清单校验和目前覆盖文件列表而非逐文件内容,在参考语料填充临床数据前仅为占位。稳定化窗口在 30 Hz 下跨 25 帧,因果实时实现还需约 0.83 s 的窗口与缓冲延迟,该延迟而非毫秒级计算开销决定端到端响应性。smoothn 的 Python 与 MATLAB 实现仅通过匹配输出的 Pearson 相关评估数值等价性,完整的 MAE 与 RMSE 对照仍列为临床部署前的验证步骤。
