PointZero:以3D点轨迹补全作为可迁移3D动力学预训练目标
核心概要
该工作提出以“3D点轨迹补全”作为预训练目标:给定单次RGB-D观测与稀疏部分3D轨迹,预测所有被观测点的未来3D轨迹,从而在不需要机器人动作标签的情况下学习可迁移的3D动力学先验;作者贡献了覆盖可变形、铰接与刚性物体的290万帧合成数据集并训练出Transformer模型PointZero,在相同数据上优于先前方法,微调后在PGND 3D动力学基准上优于基线,并在7项仿真与真实机器人操作任务中的6项上优于或持平基线,同时通过从零训练分离架构与预训练目标/数据集的贡献,并公开数据集、检查点与完整训练配方。
Figure 1 : PointZero proposes 3D point track completion as a pre-training objective for learning rich 3D dynamics priors. Given one RGB-D image and one or a few point trajectories (shown in orange), PointZero predicts the future 3D tracks of all observed scene points. PointZero is a robot-free pre-training objective for instilling 3D dynamics understanding in world models. Post-trained for dynamics modeling Zhang et al. (2025) and robot manipulation Hung et al. (2026b) , it outperforms application-specific baselines.
arXiv深度剖析
提出并验证“3D点轨迹补全”这一无需机器人动作标签的预训练目标,可产生丰富的3D动力学先验。 既有方法通常需要机器人动作标签来学习动作条件化的3D动力学,从而把网络视频数据排除在训练池之外;该目标使预训练不再依赖动作标签。 摘要层面给出目标定义与结论,并说明其可迁移到两个下游应用;具体实验细节未在所提供的文本中展开。
贡献了一个覆盖可变形、铰接与刚性物体的290万帧合成数据集,并用其训练PointZero。 相对既有工作,该数据集在物体类型与规模上提供了更广的多样性来源,用于支撑上述预训练目标。 文本明确给出“2.9 million synthetic frames”与三类物体范围,属于作者自述的数据规模与覆盖描述。
PointZero这一Transformer在相同数据上优于先前方法,并在微调后于PGND 3D动力学基准上优于基线。 在相同数据条件下比较,说明架构本身带来增益;微调至以末端执行器位姿为条件后,在近期基准上取得优势。 文本给出“outperforms prior methods on the same data”与“outperforms the baselines on the recent PGND 3D dynamics benchmark”,但未提供具体指标数值。
微调后用于预测机器人动作与3D轨迹时,在7项仿真与真实机器人操作任务中的6项上优于或持平基线;并通过从零训练分离架构与预训练目标/数据集的贡献。 把预训练目标落到模仿学习这一具体下游任务,并额外做了消融式对照以区分架构与预训练/数据的作用。 文本给出“6/7 simulated and real-world robot manipulation tasks”的计数式结果,以及从零训练的对照设置;未给出逐任务细节。
启示与展望
该结果面向以单次RGB-D观测与稀疏部分3D轨迹为输入的3D动力学预训练与下游微调场景,适用于希望在不使用机器人动作标签的情况下利用更广数据来源的研究者与工程团队;作者公开数据集、检查点与完整训练配方,便于在相同数据与基准上复现与扩展。
所提供的文本为论文摘要与元数据,未包含图表、具体指标数值、任务清单与消融细节,因此无法在此判断各下游任务的具体增益幅度与从零训练对照的量化差异;这些属于读者在阅读原文时应继续关注的问题。
