跳到主要内容
返回时间线
arXiv来源发表:

Latent-Foresight 端到端联合学习潜在分词器与流式动力学模型,在多类未来场景理解任务上稳定优于两阶段基线

相关研究与后续进展

核心概要

该工作提出 Latent-Foresight,一个端到端框架,联合学习潜在分词器与基于流的生成式动力学模型,显式塑造表征以支持时间可预测性,并通过若干防止潜在坍缩、对齐重建与生成目标的设计选择实现稳定联合优化;实验显示其学到的潜在表征在时间上更连贯,在多个未来场景理解任务与预测时域上持续优于两阶段基线,同时省去独立训练阶段,包括高分辨率适配阶段。

Source-provided article image: Latent-Foresight: End-to-End Learning Predictable Representations for Latent World Models
Figure 1 ·

Figure 1: Overview of Latent-Foresight . We jointly train end-to-end a VFM tokenizer encoder ℰ ϕ \mathcal{E}_{\phi} , decoder 𝒟 ψ \mathcal{D}_{\psi} , and flow-based predictor 𝒫 θ \mathcal{P}_{\theta} , while keeping the VFM backbone frozen. The encoder compresses per-frame features into a compact predictable latent space, followed by a normalization layer. The decoder is supervised by ℒ recon \mathcal{L}_{\text{recon}} . The predictor takes context latents and a noisy interpolation of the future latent as input, trained with ℒ FM \mathcal{L}_{\text{FM}} . Stop-gradient operations on both the future latent and the noisy input prevent collapse. ℒ aux-recon \mathcal{L}_{\text{aux-recon}} supervises the predicted features against the ground truth.

arXiv

深度剖析

提出端到端联合学习潜在分词器与流式生成式动力学模型的框架,使潜在空间被显式塑造为支持时间可预测性。 既有方法依赖两阶段流程:先用固定降维(如 PCA)或独立训练的自编码器压缩视觉基础模型特征,再在冻结的潜在空间上单独训练预测器;也有方法直接在原始 VFM 特征上施加预测器。该工作把表征学习与时间预测耦合起来,消除了这种解耦。 摘要层面的证据:作者报告了广泛实验,称其方法学到时间上更连贯的潜在表征,并在多个未来场景理解任务与预测时域上持续优于两阶段基线;具体数据集、指标与数值未在摘要中给出。

引入若干关键设计选择,使联合优化稳定进行,防止潜在坍缩,并对齐重建目标与生成目标。 两阶段流程中表征学习与预测相互独立,不存在联合优化下的坍缩风险;该工作针对端到端训练特有的稳定性问题给出设计选择。 摘要层面的证据:作者以“防止潜在坍缩”和“对齐重建与生成目标”描述这些设计选择,但未在摘要中列出具体机制或消融结果。

在消除独立训练阶段的同时保持性能优势,包括高分辨率适配场景。 两阶段基线需要分别训练压缩器与预测器;该工作报告在省去这些独立阶段的情况下仍持续优于基线,并覆盖高分辨率适配。 摘要层面的证据:作者称“eliminating separate training stages, including during high-resolution adaptation”,未给出高分辨率适配的具体设置或数值。

启示与展望

该工作面向以视觉基础模型特征空间为基础的世界建模场景,适用于需要预测场景未来演化并服务多种未来场景理解任务的设定;其目标是让潜在空间本身结构化以支持可预测动力学,并在高分辨率适配时也无需单独训练阶段。作者公开了实现代码与模型权重,便于在相同设定下复现与比较。

摘要未列出具体数据集、评价指标、预测时域长度与定量结果,也未展开防止潜在坍缩与对齐重建/生成目标的具体机制,因此无法从摘要判断优势幅度与适用条件;高分辨率适配的具体设置同样未说明。这些属于需要阅读原文方法与实验部分才能确认的开放问题。

来源