跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

TwinJEPA 在 JEPA 控制中加入离线挖掘的动作偏好监督,在所有匹配的状态型评测上取得正向基准级平均差异

该工作提出 TwinJEPA,在基于 JEPA 的离线零样本控制中,通过跨离线轨迹识别近似匹配状态并用目标条件奖励重标注构造偏好对,学习奖励差距回归与偏好分类两个仅在训练期使用的目标,从而获得动作偏好的预测性表征;在长时程导航与连续控制基准上,状态型与像素型观测均有评测,且在所有匹配的状态型评测上取得正向的基准级平均差异,分析显示当局部动作备选提供更有信息量的结果对比时增益往往更大。