跳到主要内容
返回时间线
arXiv来源发表:

D-JEPA 用已执行结果监督候选未来之间的关系,在 PushT 上把成功率提到 87.89%,并在真实机器人上提升 17 个百分点

核心概要

D-JEPA 提出一种决策对齐的潜在世界模型:它先量化“决策局部预测缺口”——在真正竞争执行的那几个候选未来中,预测目标距离更近的候选可能反而执行失败,然后用已执行结果监督一个置换等变、有界的集合算子来学习候选未来之间的决策相关关系,并把学到的决策结构写入 JEPA 兼容的未来表示,从而可通过原生潜在距离规划直接读出动作;在 PushT 上达到 87.89% 成功率、RoboTwin 平均提升 15.04 个百分点、真实机器人任务提升 17 个百分点,驾驶场景 PDMS 均值从 57.36 升到 95.34。

AI-generated editorial illustration: D-JEPA: A Decision-Aligned Latent World Model

深度剖析

论文识别并量化了一个“决策局部预测缺口”:预测几何在整体上仍然有信息量,但在最接近执行的那几个候选之间区分能力很弱。 此前关于潜在世界模型的工作关注预测未来的能力与规划代价保真度,本文把问题重新表述为“在共享同一观测上下文与目标的候选集合内,已执行结果如何监督候选之间的关系”。 在 96 个 PushT 起始状态上,每个模型都有 8 个起始状态偏好一个失败候选,尽管存在可用的成功替代;在混合结果的 top-4 短名单中,平均逆序率为 LeWM 49.0%、TD-JEPA 38.2%;在四个最低代价候选内,起始内 Spearman 相关降到 0.13 以下(LeWM 0.90→0.11,TD-JEPA 0.80→0.13)。

D-JEPA 用一个有界、置换等变的集合算子学习候选未来之间的决策相关关系,并配合受限预测器适配与共享序数接口整合多种预测几何。 与直接替换预测目标或只做标量置信度门控不同,该方法在保留完整候选集合预测上下文的同时,把监督集中在决策相关子集上,并限制对底层表示与决策分数的改动幅度。 匹配消融中关系对齐是最强的单项干预(TD-JEPA 76.95%→关系对齐 87.11%→校准组合 87.89%);同一关系算子在 128 起始机制人群上使用 LeWM 与 TD-JEPA 双证据达到 93.75%,而单源分别为 84.38% 与 83.59%;四几何实例达到校准四源融合的成功率。

学到的决策结构可以被写入 JEPA 兼容的未来表示,使对齐后的动作选择通过原生潜在距离规划接口直接恢复。 这使决策对齐不只是训练期的重排序,而是体现在部署时可用的未来几何中,从而保留原生规划接口。 精确序数实现后,原生目标距离恢复 100% 的关系动作选择与候选排序;关系读出 87.11% 成功率、35.03 ms 延迟,校准组合 87.89%、52.16 ms,序数实现 87.11%、34.02 ms;Reacher 上时间传输在五步未来内学习有符号更新,观测到的单步最大 L2 更新为 0.0017227774。

决策对齐在多种物理动力学、预训练动作生成模型、真实机器人与驾驶场景上带来执行层面的提升,并在形状与视觉变化下保持增益。 评估覆盖潜在控制、操作、预训练动作模型、物理机器人与驾驶,且各比较共享起始、目标、候选动作与执行时长,并保留参考规划器与搜索预算。 PushT 87.89%、Reacher 93.75%;RoboTwin 四个任务平均从 61.72% 升到 76.76%(+15.04 个百分点);真实 PiPER 两个任务从 64.0% 升到 81.0%(+17.0 个百分点,PushT 增益/损失 12/3,堆叠 10/2);七个驾驶场景 PDMS 均值 57.36→95.34;PushObj 三种未见几何与七种外观条件下均提升,物体颜色变化增益最大。

启示与展望

这项工作面向的是“在已有候选未来集合中选哪一个执行”的决策阶段,适用于潜在规划器、预训练 VLA 动作块、Drive-JEPA 轨迹与 V-JEPA 2-AC 候选等接口;它不改变底层预测器、搜索预算或低级控制器。方法在候选可用性更丰富时表现更好(8 个候选 81.96% 到 63 个候选 87.11%),因此更适用于能够提供较大候选池的设定。形状评估使用每个几何 100 个留出起始,视觉评估使用每种条件 50 个新起始,均从 63 个候选中选择并执行完整 25 步控制序列;驾驶报告七个场景的等权 PDMS 均值。

决策局部缺口的诊断基于 PushT 的 96 个起始状态与已记录执行,其在不同任务族中的普遍程度仍需更多证据;关系对齐与预测器适配的增益依赖校准门控与阈值,这些在文中由校准子集选定,换到新任务时需要重新校准。序数接口的尺度不变性针对序数证据,稠密描述子仍保留各自模型的几何,因此跨几何整合的效果取决于各源几何本身的质量。驾驶结果报告的是七个场景的等权均值,场景来自三个源日志,样本规模有限。真实机器人结果基于每任务 50 次配对试验,且保留同一 V-JEPA 2-AC 规划器与搜索预算。此外,本文为全文解析,但部分图表与附录细节以文字描述形式呈现,若需复现具体数值仍应查阅原文附录。

来源