跳到主要内容
返回时间线
arXiv来源发表:

SAW用四个轻量条件信号做手术视频扩散,CD-FVD降至199.19并让稀缺动作识别F1从20.93%升至43.14%

核心概要

该工作提出Surgical Action World(SAW),把视频到视频扩散重构为轨迹条件的手术动作合成,仅以语言提示、参考首帧、组织可操作区域掩码和2D器械尖端轨迹四个轻量信号为条件,在自建的12,044段腹腔镜视频片段上微调LTX-Video并引入深度一致性损失,在留出测试集上取得CD-FVD 199.19(对比SurgSora的546.82)与FVD 224.28,并展示用生成视频增强稀缺动作后真实测试集上动作识别F1提升(clipping 20.93%→43.14%,cutting 0.00%→8.33%),以及从仿真器导出轨迹渲染器械-组织交互视频的初步可行性。

Source-provided article image: SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

深度剖析

构建了12,044段腹腔镜视频片段的数据集,含视频级工具-动作标签(clipping、grasping、cutting、dissecting)、器械类别(grasper、hook、clipper、scissors)、组织可操作区域以及帧级器械尖端像素坐标轨迹。 此前手术视频生成方法多依赖逐帧分割掩码或时空场景图等昂贵或难以在推理时获得的中间表示,该数据集把监督信号压缩为轻量时空标注。 数据来自101段源视频(21段YouTube视频与HeiChole、Cholec80、SurgVU、CRCD四个公开数据集),按源视频划分训练11,502段、测试542段,统一为81帧、25 fps、1024×576。

提出以LTX-Video为骨干、用IC-LoRA微调的条件视频扩散方法,把视频到视频扩散重构为轨迹条件的手术动作合成,推理时只需语言提示、参考首帧、组织可操作区域掩码与2D器械尖端轨迹。 相比依赖密集标注的HieraSurg、依赖结构化场景图的SG2VID以及推理窗口受限(W=21)的SurgSora,该方案在推理阶段不需要昂贵标注或结构化中间量。 在单张NVIDIA A100上以IC-LoRA微调7,500步(α=128,lr=2×10⁻⁴,AdamW,bfloat16),推理用50步去噪、guidance scale=3.5,生成81帧视频。

引入深度一致性损失LDC:训练时用Depth Anything V2生成深度掩码视频,通过交叉注意力层与投影头从去噪后的RGB潜变量重建掩码深度潜变量,以Smooth ℓ1损失约束,从而在推理时无需深度输入即可约束Z方向几何合理性。 所有空间条件信号本身都是2D输入,该损失把深度监督只放在训练阶段,避免推理时增加深度条件。 消融显示去掉LDC后CD-FVD由199.19升至207.59,作者据此认为器械与组织运动的时间一致性下降;完整模型在各项指标上最均衡。

在留出测试集上SAW取得最低FVD 224.28与最低CD-FVD 199.19,并优于WAN(FVD 439.60、CD-FVD 429.67)、LTXb(319.37、504.31)与SurgSora(541.61、546.82);同时展示两个下游用途:用287段合成视频(110段clipping、177段cutting)增强后,时空CNN在真实测试集上clipping F1由20.93%升至43.14%、cutting由0.00%升至8.33%;以及用Isaac Lab仿真器导出的器械分割、尖端轨迹与组织可操作区域驱动生成器械-组织交互视频。 把生成质量评估与下游任务收益放在同一框架内报告,而不只停留在视觉指标。 生成指标在留出测试集上报告;增强实验在真实测试集上评估两个识别模型(时空CNN与ViT),ViT上cutting由30.77%升至47.06%,但clipping由84.62%略降至83.64%、grasping在两者上均略降;仿真部分作者明确称为初步概念验证。

启示与展望

该结果面向腹腔镜手术视频生成,尤其是胆囊切除术场景下的器械-组织交互;适用对象是需要可控合成手术动作视频的研究者与仿真开发者。它使推理阶段不再依赖逐帧分割掩码或场景图等昂贵中间量,只需语言提示、参考首帧、组织可操作区域掩码与2D尖端轨迹,因此更易扩展;同时为稀缺动作增强与从仿真器轨迹渲染交互视频提供了可复用的流程。作者把仿真部分定位为初步概念验证,并指出后续需处理器械关节运动学、更多器械与场景以及实时推理。

消融显示去掉affordance或language后部分指标反而略好(如w/o Affordance的FVD 223.78、w/o Language的FVD 219.23),而作者仍保留全部条件信号以追求整体均衡,这些信号在何种场景下真正起作用仍是开放问题。增强收益在两类识别模型上并不一致:时空CNN的clipping与cutting明显提升,ViT的clipping与grasping略降,说明合成数据的收益依赖模型与动作类别。仿真部分为定性展示,未报告定量指标,实时性与器械关节运动学尚未验证。此外,生成视频固定为81帧,更长时序与更多器械、解剖场景的表现有待考察。

来源