跳到主要内容
返回时间线
arXiv来源发表:

异步重规划不再每次从独立噪声起步:共享噪声轨迹跟着实际执行位移走,真机叠衣成功率96.7%

导语

生成式机器人策略在异步重规划时不再每次从独立高斯噪声重新起步,而是让相邻动作块的初始噪声按实际执行位移对齐并沿动作时间相关,真机叠衣成功率96.7%、物体收纳90.0%。

AI-generated editorial illustration: Execution-Aligned Progressive Noise for Consistent Asynchronous Replanning in Generative Robot Policies

正文

连续异步重规划中,相邻两次推理的随机起点被显式关联起来,新生成的动作块从与执行一致的生成状态继续,而不是从独立噪声重启。 此前的做法把约束集中在已提交或即将执行的动作前缀上,前缀之外的剩余后缀仍由新采样的随机源决定,跨推理的随机状态依赖没有被建模。 对标准策略做流反演后发现,同一回合内相邻动作窗口的源隐变量存在明显时间局部性,相关性随窗口间隔增大而衰减,跨回合相关性接近零,且相关峰随实际执行位移移动而非固定在同一索引位置。

方法在块间和块内两个层面引入结构化随机性:块间用一条跨策略调用持续存在的共享自回归过程,按实际执行位移重新索引;块内用另一条自回归过程沿动作时间引入相关。 标准流匹配在每个动作时间位置独立采样高斯源,因此不同随机初始化会把时间上重叠的推理推向各自高概率但不同的局部模式。 在 Kinetix 的 mjc_swimmer 任务上从 ttRTC 逐步加入块间噪声与块内噪声,成功率从 46.60 升到 76.89、再到 78.85,完整模型为 79.26,块间相关贡献主要增益。

对齐后的随机历史与已提交动作上下文一起作为策略条件,使新动作块从执行一致的生成状态继续。 仅靠相关噪声并不能告诉策略哪一段历史随机状态对应当前窗口,因此需要显式对齐并注入条件。 训练时从评测支持范围内采样延迟与位移,并以一定概率丢弃整段历史、将当前源独立重采样并把对齐历史与有效性掩码置零,以覆盖回合开始和历史无效的情形。

接下来

下一步可在更多基础策略与更多延迟区间上验证该源结构是否同样有效,尤其是把低延迟与高延迟两套协议统一到单一模型的连续延迟扫描中。做异步部署的团队可以在保留原有动作块执行逻辑的前提下,把共享自回归源与对齐历史条件接入自己的流匹配策略,并观察在自身延迟分布下的表现。

低延迟与高延迟两组实验各自使用匹配的训练或微调协议,因此两组数字不能直接当作单一模型的连续延迟曲线来读。真机两项任务分别只有 20 次和 30 次试验,成功率差异的稳定性仍需更多试验确认。源结构改变了完整源的联合协方差,模型需要训练来适配,这一点在迁移到新策略时的代价值得关注。

来源