arXiv 2026年10月1日Dream4ACT 把目标关节配置渲染成四个固定虚拟相机下的“动作视图”,用共享视频自编码器与扩散 Transformer 在掩码流匹配下联合建模物理相机观测与动作视图,并以免训练、受 URDF 约束的多视角匹配恢复可执行关节目标;在 RoboTwin 2.0 上取得 90.50%(干净)与 87.46%(随机化)成功率、平均 88.98%,TriWorldBench 总分 65.66,闭环评测覆盖五个仿真本体与四个真实平台。Dream4ACT 把目标关节配置渲染成四个固定虚拟相机下的“动作视图”,用共享视频自编码器与扩散 Transformer 在掩码流匹配下联合建模物理相机观测与动作视图,并以免训练、受 URDF 约束的多视角匹配恢复可执行关节目标;在 RoboTwin 2.0 上取得 90.50%(干净)与 87.46%(随机化)成功率、平均 88.98%,TriWorldBench 总分 65.66,闭环评测覆盖五个仿真本体与四个真实平台。Dream4ACT 用固定视角动作视图统一多本体视频-动作建模,RoboTwin 2.0 平均成功率 88.98%Dream4ACT 把目标关节配置渲染成四个固定虚拟相机下的“动作视图”,用共享视频自编码器与扩散 Transformer 在掩码流匹配下联合建模物理相机观测与动作视图,并以免训练、受 URDF 约束的多视角匹配恢复可执行关节目标;在 RoboTwin 2.0 上取得 90.50%(干净)与 87.46%(随机化)成功率、平均 88.98%,TriWorldBench 总分 65.66,闭环评测覆盖五个仿真本体与四个真实平台。Dream4ACT 把目标关节配置渲染成四个固定虚拟相机下的“动作视图”,用共享视频自编码器与扩散 Transformer 在掩码流匹配下联合建模物理相机观测与动作视图,并以免训练、受 URDF 约束的多视角匹配恢复可执行关节目标;在 RoboTwin 2.0 上取得 90.50%(干净)与 87.46%(随机化)成功率、平均 88.98%,TriWorldBench 总分 65.66,闭环评测覆盖五个仿真本体与四个真实平台。