TwinJEPA 在 JEPA 控制中加入离线挖掘的动作偏好监督,在所有匹配的状态型评测上取得正向基准级平均差异
相关研究与后续进展核心概要
该工作提出 TwinJEPA,在基于 JEPA 的离线零样本控制中,通过跨离线轨迹识别近似匹配状态并用目标条件奖励重标注构造偏好对,学习奖励差距回归与偏好分类两个仅在训练期使用的目标,从而获得动作偏好的预测性表征;在长时程导航与连续控制基准上,状态型与像素型观测均有评测,且在所有匹配的状态型评测上取得正向的基准级平均差异,分析显示当局部动作备选提供更有信息量的结果对比时增益往往更大。
Figure 1: Overview and key insight of TwinJEPA. A: A transition-wise temporal-prediction objective such as TD-JEPA learns goal-conditioned temporal structure from action-conditioned transitions, but does not explicitly compare alternative actions in similar states. B: TwinJEPA mines action-diverse transition pairs from local state neighborhoods and derives reward-gap and preference targets through goal-conditioned relabeling. C: Temporal prediction and pairwise supervision jointly train the shared representation to preserve trajectory-level temporal structure while encoding local distinctions between actions associated with different goal-conditioned outcomes. The auxiliary heads are used only during training and introduce no additional inference-time computation.
arXiv深度剖析
提出 TwinJEPA,把离线挖掘的动作偏好监督叠加到 JEPA 式控制之上,使表征同时保留长时程时间结构与局部动作之间的细粒度区分。 此前的动作条件时间预测在转移层面孤立地监督动作,当相似状态对应不同目标条件结果时,对哪个动作更优提供的信息有限;TwinJEPA 通过偏好对补充这一信息。 论文摘要层面给出方法构成与动机,并报告在长时程导航与连续控制基准上的评测,覆盖状态型与像素型观测。
偏好对的构造方式是跨离线轨迹识别近似匹配状态,并用目标条件奖励重标注生成偏好对。 把偏好学习的数据来源放在既有离线行为数据内部挖掘,而非依赖额外交互或在线采样。 摘要明确描述该构造流程,但未给出匹配判据的具体阈值或数据规模。
训练使用两个互补目标:奖励差距回归保留结果差异的幅度,偏好分类捕捉备选动作的相对排序。 幅度与排序被分开建模,而非只做单一偏好信号。 摘要说明两个目标均只在训练期使用,不增加推理期开销。
在所有匹配的状态型评测上取得正向的基准级平均差异,且跨领域与观测模态的分析显示,当局部动作备选提供更有信息量的结果对比时增益往往更大。 把增益大小与局部动作对比的信息量联系起来,而不仅是报告总体提升。 摘要报告的是基准级平均差异与跨领域、跨模态的趋势性分析,未给出具体数值、样本量或逐任务结果。
启示与展望
该工作面向离线零样本控制:表征从固定的行为数据中学习,评测集中在长时程导航与连续控制基准,并覆盖状态型与像素型观测。偏好监督只在训练期使用,因此部署时不增加推理开销,适合已有离线轨迹、希望在不增加在线交互的前提下改进目标条件控制的场景。对希望把局部动作比较信号接入 JEPA 式表征学习的研究者与工程实践者,这套构造偏好对与双目标的流程可直接作为起点。
摘要给出的是基准级平均差异与跨领域、跨模态的趋势,未列出具体数值、样本量、逐任务结果与统计检验,因此增益幅度与稳定性仍需看正文。近似匹配状态的判定标准、偏好对的数量与质量如何影响结果,摘要未展开。两个训练目标之间的权重与相互作用、以及在不同离线数据覆盖度下的表现,也是读者会继续追问的方向。
