视频到模型框架用U-Net与时空CNN从视频自动辨识缝合线CBF–CLF–QP参数,在未见运动上以低跟踪误差复现线行为
核心概要
该工作提出视频到模型框架:先用U-Net分割与曲线跟踪从单目视频中提取有序缝合线节点轨迹,再由时空CNN估计CBF–CLF–QP结构化模型的连通性、刚度与速度保持参数,并在用户给定针速度下仿真;在未参与训练的虚拟材料与非训练花瓣式针运动上,配置后的模型能以低跟踪误差复现观测线行为,减少人工调参。
Figure 1: Overview of the proposed video-to-model framework for automatic thread-model configuration. An input video is fed into a perception module to detect the centerline of the DLO. This object is then fed into a parameter estimator module which enables a CBF–CLF–QP simulation of the object.
arXiv深度剖析
提出端到端视频到模型流程,把观测到的缝合线运动自动转换为CBF–CLF–QP模型的参数向量,从而无需人工调参即可实例化针对该线的模型。 此前CBF–CLF–QP框架的参数需人工选择以匹配同一针运动下的观测响应;该工作改为从视频观测直接辨识参数。 在未参与训练的虚拟材料与未出现在训练集中的非对称花瓣式针运动上评估,报告了参数估计与QP建模误差表,并给出轨迹重建对比。
感知模块用四级U-Net输出线概率图,经时序滤波、形态学闭运算、骨架化与图遍历(含自交叉处利用前一帧方向、Euler路径回退)得到时序一致的有序节点轨迹。 将分割、后处理与曲线跟踪组合为可输出与CBF–CLF–QP离散节点表示兼容的轨迹,并处理自交叉与端点方向一致性问题。 分割数据由仿真轨迹渲染生成,共十段视频、每段120帧,六段训练、两段验证、两段测试;训练损失为加权BCE、Dice与clDice组合;报告了大多数帧成功获得有序中心线及对应的跟踪成功率。
时空CNN以每节点每帧十二维特征(相对针位置、归一化速度、节点间距、局部弯曲、归一化CBF与CLF、沿线位置、针速度、速度上下文)为输入,经节点编码、沿节点维一维卷积、空间注意力、GRU与四头时间注意力输出三个归一化参数。 把参数辨识建模为学习映射,并用跨运动一致性损失促使网络识别材料相关参数而非特定激励运动。 训练数据为200种虚拟材料、每种十种激励运动、每条轨迹400步;按材料划分140训练、30验证、30测试;采用监督参数损失与跨运动一致性损失。
在参数级损失之外引入可微多步QP微调,用预测参数生成的轨迹计算12步rollout的平均跟踪损失反向传播,使预测增益在仿真中产生低跟踪误差。 指出仅用参数级损失不能保证仿真跟踪误差低,因此增加轨迹级微调;该损失在训练阶段因计算与内存开销大、梯度不稳定而改在微调阶段引入。 微调时每轮使用48个随机rollout窗口、批大小2、学习率;由于CBF–CLF–QP仿真器可微,误差可传播通过全部12个仿真步。
启示与展望
该结果面向平面运动、单目视频、线在流体中由针牵引的场景,且假设整段视频中材料与模型参数保持不变;参数辨识在归一化参数空间对多个重叠时间窗估计取平均,窗口最多400帧、相邻窗口间隔200帧、每两帧取一帧输入。对使用者而言,这意味着当具备一段可观测的针—线交互视频、并已选定CBF–CLF–QP作为结构化模型时,可以据此自动获得一组线特定参数并直接用于仿真,而无需逐参数手工整定;作者也指出后续将面向更稳健的视觉跟踪、对参数更敏感的激励轨迹,以及不同材料的真实缝合线实验。
结果建立在仿真渲染的虚拟材料与虚拟针运动之上,真实缝合线、真实光照与遮挡条件下的表现尚待检验;作者指出分割与中心线跟踪的偶发误差会引入节点观测偏差并影响参数预测,且部分激励轨迹不足以区分各参数影响、难以唯一辨识。此外,加载文本中若干数值(如时间步长、帧率、总时长、跟踪成功率、参数范围与部分超参数)在公式与表格处缺失,因此这些量的具体取值无法在此确认,读者若需精确复现应查阅原文图表。
