跳到主要内容
返回时间线
arXiv来源发表:

PAM 用本体感受草图表达长时程意图,在四个真实双臂任务上把成功率从 47.5% 提升到 75.0%

相关研究与后续进展

核心概要

该工作提出本体感受动作模型(PAM),在单个 transformer 去噪器中联合生成机器人剩余关节空间路径的紧凑、无时间索引草图与稠密可执行动作块,草图按弧长而非时间参数化以捕捉与执行时序无关的几何意图,并用块因果注意力与错位去噪调度维持草图到动作的有向依赖;在仿真中于 Push-T 与 LIBERO-Long 上优于仅动作的对照方法,在四个真实双臂任务上把成功率从 47.5% 提升到 75.0%。

Source-provided article image: Proprioceptive Sketches as Long-Horizon Intent for Generative Action Policies
Figure 1 ·

Figure 1: PAM replans during a real-world dual-arm long-horizon task. At each step, PAM jointly generates a proprioceptive sketch 𝐙 t \mathbf{Z}_{t} of the future configuration-space path and a short action chunk 𝐀 t \mathbf{A}_{t} conditioned on the sketch, while only 𝐀 t \mathbf{A}_{t} is executed. For visualization, the sketch and the action chunk are mapped through forward kinematics and projected into the camera view.

arXiv

深度剖析

PAM 在单个 transformer 去噪器内同时生成两类输出:机器人剩余关节空间路径的紧凑、无时间索引草图,以及稠密可执行动作块。 此前的长时程结构多由语言计划、子目标图像或视频预测提供,这些表示生成代价高且仍需翻译为机器人运动;直接预测未来运动虽免去翻译,但稠密且按时间索引的轨迹需要大量参数覆盖整个剩余任务,且在短时程上基本重复动作块。PAM 把长时程意图压缩为草图并与动作块联合生成。 摘要层面的方法描述,说明联合生成发生在单一 transformer 去噪器内;未给出模型规模、训练数据或消融细节。

草图按弧长而非时间参数化,从而表达对执行时序不变的几何意图。 相对按时间索引的稠密轨迹预测,弧长参数化把路径几何与执行速度解耦,使长时程意图不必以时间序列形式承载。 摘要层面的设计说明;未提供关于时序不变性的定量验证。

块因果注意力与错位去噪调度维持有向的草图到动作依赖,使动作 token 在整个采样过程中条件于逐步变干净的草图。 这为草图与动作的联合生成提供了明确的依赖方向与采样机制,而非让两者独立或无序地生成。 摘要层面的机制描述;未给出注意力模式或调度参数的细节。

在仿真中 PAM 于 Push-T 与 LIBERO-Long 上优于仅动作的对照方法;在四个真实双臂任务上把成功率从 47.5% 提升到 75.0%。 相对仅预测动作块的生成式策略,加入草图这一长时程意图表示带来了仿真与真实双臂任务上的性能提升。 摘要报告了仿真基准名称与真实任务的成功率数值对比(47.5% 对 75.0%);未给出任务清单、试验次数、统计不确定性或基线配置。

启示与展望

该工作面向需要长时程意图的生成式机器人策略,适用于关节空间动作生成场景,其效果在仿真基准 Push-T 与 LIBERO-Long 以及四个真实双臂任务上被报告。对希望避免语言计划、子目标图像或视频预测等昂贵中间表示的机器人学习研究者与工程实践者,PAM 提供了一条以本体感受草图承载长时程意图、并在同一去噪器内直接产出可执行动作块的路径。

摘要未说明真实双臂任务的具体内容、试验次数与统计不确定性,也未给出仿真基准上的量化幅度与消融结果,因此草图相对动作块带来的增益来源尚待展开。弧长参数化在路径几何复杂或需要精确时序控制的任务中如何表现,以及块因果注意力与错位去噪调度的具体配置对结果的影响,都是读者可继续关注的方向。本文档为摘要层面的解析,未包含正文图表与实验细节,上述判断以摘要所述内容为限。

来源