AnisoWM 用可学习对角协方差替换各向同性正则,在四个视觉控制环境中全部超过 LeWM 的规划成功率
核心概要
该工作指出各向同性高斯正则(SIGReg)会让潜空间欧氏规划代价与任务代价排序不一致,提出 AnisoWM 与 ΛReg:在固定迹与各向异性约束下学习对角协方差目标,仅改变训练期正则、保留原预测目标与欧氏规划器,并在 TwoRoom、Reacher、PushT、Cube 四个视觉控制环境中规划成功率均高于 LeWM,潜代价与任务结果的排序一致性也更好。
深度剖析
论文证明:预测准确且表示不塌缩,并不保证潜空间规划代价与任务代价对齐。 此前 SIGReg 的各向同性高斯目标来自线性/非线性探测下的表示质量准则,而非规划代价是否合适;该工作把这一目标与规划排序直接联系起来。 线性高斯设定下,当过程噪声趋于零时联合目标选出近似白化的表示,欧氏潜距离等价于按状态协方差逆加权;即使预测为精确条件均值、预测损失消失,有限时域构造中仍存在正的规划遗憾;二维 MLP 玩具实验中,随噪声尺度下降,留出条件均值预测误差显著下降,而十个种子上的平均归一化物理规划遗憾仍接近该逆协方差参考值。
提出 AnisoWM 与 ΛReg:把固定的各向同性高斯目标换成可学习的对角协方差,在固定迹与条件数约束下由预测训练决定方差在各潜方向上的分配。 与改变预测结构(Fast-LeWM)、增加多时域与可达性监督(RC-aux)、或替换/增补终端规划代价(TRM、Decision-Metric Alignment)不同,这里只改表示正则项,预测目标、预测器结构与欧氏规划器保持不变,协方差目标只在训练中使用、规划时可丢弃。 理论给出学习目标下极限度量的选择规则,并给出与任务度量成比例的对齐条件;二维闭式分析显示在特定协方差序下,各向异性界取某中间值时极限遗憾为零,相对各向同性基线在界小于该值时更低、大于该值时更高,即过度各向异性会抬高遗憾。
在四个视觉控制环境中,AnisoWM 的规划成功率全部高于 LeWM,且潜代价与任务结果的排序一致性更好。 相对 LeWM 基线,改进来自表示几何而非规划器或预测器;同时给出表示层与含预测器 rollout 两种代价下的排序诊断,用于区分差异来自表示本身还是来自预测器。 主比较使用 192 维表示、统一各向异性界(目标方差比至多两倍)、每环境三个训练种子;成功率提升出现在全部四个环境,排序诊断在四个环境中均改善,其中仅表示代价下 PushT 几乎不变,说明表示几何与预测器 rollout 的贡献因环境而异;局部代价几何中潜代价与任务代价的 Spearman 秩相关在 Cube 与 PushT 均上升。
同一各向异性界下,训练学到的目标谱因环境而异,且放宽各向异性界并非单调有益。 说明约束只限定可行族,具体方差分配由预测训练与训练分布决定,而不是由界本身决定。 共享界下高于均值目标方差的坐标数从 PushT 的 95 到 Reacher 的 124 不等;TwoRoom 中分配在达到条件数界后仍继续演化;各向异性界扫描中不同环境的最优取值不同,且该扫描为单次训练运行,作者将其定位为敏感性诊断而非调参比较。
启示与展望
该结果面向使用欧氏潜距离做目标规划的 JEPA 式潜世界模型,尤其是沿用 LeWM 数据、架构与视觉目标规划协议的场景;方法只替换训练期正则目标,预测目标、预测器结构与规划器不变,因此可直接叠加在既有 LeWM 流程上。分析部分给出的是线性高斯设定下的度量选择与有限时域分离,以及二维闭式遗憾随各向异性界的变化;实验部分覆盖 TwoRoom、Reacher、PushT、Cube 四个视觉控制环境,主比较为每环境三个种子、统一各向异性界。对希望在不改动规划器的前提下调整表示几何的研究者,这提供了一条可复现的改造路径。
各向异性界的敏感性扫描为单次训练运行,作者也将其定位为敏感性诊断,因此不同环境偏好的界值仍需更多重复实验确认;仅表示代价下的排序在 PushT 几乎不变,说明表示几何与预测器 rollout 的相对贡献随环境变化,其机制尚未完全分离;理论上的零遗憾与对齐条件依赖线性高斯模型、特定协方差结构与二维闭式设定,向高维非线性系统的推广以稳定性论证而非选择定理的形式给出;此外,本总结依据的是论文全文与摘要文本,未包含图表原始数据,因此具体数值细节以原文为准。
