跳到主要内容
返回时间线
arXiv来源发表:

不给轨迹也能有预见:用隐变量运动趋势引导3D扩散策略

核心概要

该工作提出 Movement Trend Guidance:从点云与机器人状态的短历史中学习一个紧凑的隐变量来表示交互演化趋势,训练时仅用稀疏的未来夹爪状态监督该隐变量,推理时只保留隐变量作为面向未来的条件,在几乎不增加参数(较 DP3 增加 3.52%)的前提下,于 RoboTwin2.0、LIBERO-40、DexArt 与五项真实机器人任务上一致提升 3D 扩散策略的成功率。

AI-generated editorial illustration: Learning Foresight without Explicit Trajectories for 3D Diffusion Policies

深度剖析

提出一种不依赖显式规划的“预见”形式:策略不仅判断当前可行的动作,还编码交互正在朝何处发展。 与预测路点、关键帧或轨迹的做法不同,这里不产生中间控制目标,未来信息只用于塑造表示,因而保留了从当前几何修正局部动作的自由度。 论文以方法设计与消融支撑:显式未来点条件化在 LIBERO-40 上低于完整模型,说明“用未来预测塑造隐变量”优于“直接条件化未来点”。

给出轻量实现:未来状态监督一个紧凑隐变量,该隐变量走标准全局条件通路,额外的门控 FiLM 调制只施加在 UNet 瓶颈处。 相较 DP3 仅增加 9.23M 参数(+3.52%,总计 271.67M),推理延迟从 50.28 ms 增至 50.90 ms(+1.23%),且保留原有的稠密动作与滚动时域形式。 参数与延迟为文中报告的具体数值;注入方式的对比显示瓶颈门控 FiLM 达 62.8%,全块门控 55.8%,交叉注意力 52.9%。

在多套仿真基准与真实机器人上取得一致提升。 50 任务 RoboTwin2.0 混合训练 62.8% 对 56.1%,LIBERO-40 为 71.93% 对 37.08%,DexArt 平均 59.25% 对 52.0%,五项 SO101 真实任务 72.0% 对 49.0%。 各基准使用其官方协议与固定演示预算(如 RoboTwin2.0 每任务 50 条演示、100 次评测;LIBERO-40 每任务 50 条演示、三个随机种子各 50 回合;真实任务每任务 50 条演示、20 次 rollout)。

消融表明增益主要来自“未来监督的表示学习”,而非单纯增加表示容量。 参数匹配但去掉未来损失的隐变量变体仅比 DP3 高约 1 个百分点,加入未来监督后再提升约 34 个百分点;同时运动趋势条件化在 ACT 这一非扩散骨干上也把六任务平均成功率从 24.00% 提升到 51.67%。 消融在固定 50 任务混合训练协议下进行,并保持相同的 64 维任务嵌入;ACT 结果被作者限定为所评测的六任务设定。

启示与展望

该方法面向以点云与机器人状态为观测、采用稠密动作与滚动时域执行的 3D 扩散策略,适用于需要多阶段协调的操作场景,如双臂交接、堆叠与抓取搬运;作者报告在接触密集与多阶段任务上增益最大,并给出可复现代码。对希望在不引入显式规划接口的前提下为策略加入前瞻信息的研究者与工程实践者,这一设计提供了可直接叠加的轻量路径。

真实机器人验证限于 SO101 平台与五项任务,作者明确将跨物体、场景与扰动的更广泛验证列为未来方向;失败分析指出机械臂遮挡导致点云不完整时,趋势估计与基线都会受影响,因此精确接触与放置类任务的增益较小。此外,DexArt 采用“最佳五个检查点平均”的聚合方式,与 LIBERO 固定第 1000 轮的报告口径不同,跨基准比较时需留意这一差异。若只读到摘要而未见完整图表,各任务级细节与消融的完整数值仍需回到原文核对。

来源