跳到主要内容
返回时间线
arXiv来源发表:

Dream4ACT 用固定视角动作视图统一多本体视频-动作建模,RoboTwin 2.0 平均成功率 88.98%

相关研究与后续进展

核心概要

Dream4ACT 把目标关节配置渲染成四个固定虚拟相机下的“动作视图”,用共享视频自编码器与扩散 Transformer 在掩码流匹配下联合建模物理相机观测与动作视图,并以免训练、受 URDF 约束的多视角匹配恢复可执行关节目标;在 RoboTwin 2.0 上取得 90.50%(干净)与 87.46%(随机化)成功率、平均 88.98%,TriWorldBench 总分 65.66,闭环评测覆盖五个仿真本体与四个真实平台。

AI-generated editorial illustration: Dream4ACT: A Shared Visual Action Interface for Multi-Embodiment Video-Action Modeling

深度剖析

提出“动作视图”这一固定形状的多视角视觉动作表示:通过 URDF 正向运动学与渲染,把当前与目标关节配置渲染为 front、top、left、right 四个固定虚拟相机图像,其张量形状与关节维度无关,同时保留本体特有的关节几何。 此前的视觉接口多编码末端执行器量(如 SpatialVAM 的虚拟视角热力图、Action Images 的多视角图像),或把动作编码为潜帧、骨架条件;本文显式编码完整手臂与夹爪配置,且虚拟相机独立于物理观测相机,因此动作视图构建不需要物理相机外参标定。 方法层面给出动作视图定义式与渲染约定(基座-手臂连杆黄色、手臂节点蓝色、夹爪由绿到红表示开合),并在附录 A.2 说明按数据集-本体-任务组保存 task_rig.json、固定外参、按训练帧关节投影的占用约束选择内参;消融中同一批记录关节状态序列下,动作视图渲染相对相机对齐骨架条件在 DROID 上把 PSNR 从 23.19 提升到 24.33 dB、SSIM 从 0.899 到 0.906、LPIPS 从 0.105 降到 0.093。

用共享视频自编码器与扩散 Transformer 在掩码流匹配下联合建模 RGB 观测与四条动作视图流,以模态/视角嵌入与序列专属 RoPE 偏移区分序列,同一套权重支持前向动力学、逆向动力学与联合生成三种模式。 已有统一视频-动作模型或使用独立扩散解码器与掩码输入(UVA),或以独立噪声水平耦合视频与动作扩散(UWM、Pelican-Unify 1.0),或依赖模态专用头/专家;本文把动作表示本身换成视觉流,使异构关节空间共享同一分词与预测接口,训练时按 0.2/0.2/0.6 采样三种模式,并按 0.7/0.3 采样 I2V 与 V2V 时间前缀条件。 给出掩码流匹配的干净/加噪潜变量构造、仅在被破坏位置计算速度场损失的公式,以及三种模式对应的流集合表;附录 A.1 列出批大小 16、AdamW、余弦调度、1000 步预热、仿真动作块 40、真实动作块 80 等设置。

提出免训练、受 URDF 约束的多视角动作恢复:对预测动作视图做二值化与膨胀,用 IoU 与单侧 Chamfer 距离对候选配置的渲染打分,再经逐帧 LM/Gauss–Newton 估计与三次 B 样条窗口级平滑、颜色解码夹爪,得到可执行关节目标,无需学习本体专用动作解码器。 相对 Hydra-0 的训练动作头、Masked Visual Actions 的学习逆动力学模型、SpatialVAM 学习的旋转与夹爪解码,本文把恢复交给几何匹配;相对 BridgeV2W、GeniWorld 依赖与观测视角对齐的 URDF 渲染,本文用固定虚拟相机,从而把物理相机外参从动作视图构建与恢复中移除。 给出打分函数(IoU 项加 Chamfer 项)、恢复流程表,以及附录 A.5 在 31 个共享任务、每任务 5 条留出轨迹上从真值动作视图恢复的误差:Aloha-Agilex 位置 1.39 mm/旋转 1.57°、Piper 1.66 mm/1.71°、ARX-X5 1.22 mm/1.95°、Franka-Panda 4.11 mm/9.45°、UR5-Xsg 11.85 mm/21.39°。

闭环与生成评测显示同一检查点可跨本体执行:RoboTwin 2.0 上 50 任务平均成功率 88.98%(干净 90.50%、随机化 87.46%),前向动力学模式下 TriWorldBench 总分 65.66,真实平台在 place_block 与 wipe_plate 两项共同任务上平均成功率 85.0%–90.0%。 作者报告其平均成功率高于所引用的一个基线 7.76 与 10.7 个百分点并略高于 Motus,但低于 LingBot-VA 与 Fast-WAM;TriWorldBench 上与 BWM 的 65.54 相当,并在所列方法中取得最高的 P3D、MQ、TC,VQ 与 BWM 持平。 仿真按官方任务成功准则每任务每配置 100 次试验;多本体评测用五本体联合训练检查点、31 个任务交集、每任务每机器人 25 次试验(每设置 775 次);真实世界每本体-任务对采集 60 条演示、共 720 条,覆盖 12 对;TriWorldBench 复用同一检查点、不做基准专用微调,按官方提交协议生成头/腕视频。

启示与展望

该接口面向关节控制的机械臂操作:训练与评测覆盖五个仿真本体(Aloha-Agilex、ARX-X5、Franka-Panda、Piper、UR5-Xsg)与四个真实平台(Aloha-Agilex、TienYi2.5 Pro、Franka Research 3、UR5e),真实世界任务为 place_block、wipe_plate 以及双机械臂的 stack_blocks、storage_item。适用前提是具备该本体的 URDF 与与训练一致的渲染约定,虚拟相机预设固定并跨帧、跨回合复用,测试轨迹不参与预设确定。对希望以单一共享权重覆盖多种运动学结构、且能接受块级执行的研究者与工程团队,这一表示可直接复用;其恢复流程不依赖学习的本体专用解码器。

恢复精度依赖生成动作视图的保真度与几何可观测性,也依赖 URDF 与训练渲染约定的一致性,运动学不匹配可能影响物理执行;作者指出 Franka-Panda 与 UR5-Xsg 在仿真中由两条单臂拼装而非一体化双臂设计,其较低成功率可能与这种集成方式带来的臂间协调与关节目标跟踪限制有关。真实世界评测使用各平台标称背景、无背景变化与额外干扰物,任务覆盖有限。延迟方面,真实设置下每 80 步块生成约 6.9 s、恢复约 2.7 s,因此当前实现支持块级执行而非实时逐步重规划;更广任务覆盖与向未见本体的迁移仍待验证。此外,TriWorldBench 对比表中部分基线单元格在所提供的材料中为空,因此只能就文中明确给出的数值进行比较。

来源