Memorizon 让世界模型在固定序列长度下训练任意长跨度:重访一致性在八个记忆指标中领先五个
核心概要
Memorizon 提出一种训练配方:每个被评分的 chunk 按相机共视性各自检索 top-k 潜变量,其并集构成容量有界的共享记忆库,使训练样本可覆盖任意长跨度而注意力序列长度保持不变;在滑动窗口基线上重访一致性全面提升,跨度长到覆盖首次访问后进一步提升,代价是图像质量下降。
深度剖析
Memorizon 把“训练样本覆盖的跨度”与“注意力序列长度”解耦:样本可覆盖任意长的 chunk 跨度,但只对最后若干 chunk 计分,之前的未检索历史从不被 token 化,每个被评分 chunk 按相机共视性检索自己的 top-k 潜变量,其并集构成共享记忆库,库容量有界,因此序列长度不随跨度增长。 此前做法要么加长训练窗口(注意力代价二次增长、激活内存线性增长),要么用稀疏注意力或历史压缩降低处理长序列的成本,但都不改变一个样本能关联哪两段访问;Context-as-Memory 式的一次性检索让每个 chunk 读同样的帧,而本文让每个被评分 chunk 各自检索并共享并集。 论文给出 Proposition 1 证明共享库是无损的(每个 chunk 从库中重选可恢复它从全部历史中会选的集合),并给出库容量上界;训练成本表显示跨度从 10 s 增到 40 s 时序列仍在上界、峰值内存不变,每步仅增加少量时间。
检索在每一个划分上都提升重访一致性,且训练跨度长到覆盖首次访问后还能再提升,但超过该点后更长的跨度不再有帮助。 论文把跨度当作可采样的变量而非固定片段长度,并区分了检索与跨度各自的作用:检索让模型能读到远早于训练跨度的帧,跨度则决定检索到的内容是否包含首次访问。 消融表在已见场景、未见场景和网络照片三个划分上逐项加入检索、记忆库与更长跨度;论文报告 40 s 跨度在 10 s 基础上进一步提升,而 80 s 跨度在多个划分上回落,并指出跨度 20、40、80 s 分别覆盖语料中一定比例的重访首次访问。
模型确实读取记忆库中的内容,而不是把它当作填充:改变库内容会显著改变重访表现。 论文用固定检查点、轨迹和随机种子、只替换库槽位内容的对照实验直接检验“检索是否被使用”,这是对“检索机制未被使用”这一常见疑虑的直接回应。 论文报告中途路径重访相关性在检索库下为 0.440,换成同一历史中的随机帧降到 0.207,空库降到 0.105,换成另一 episode 的帧降到 0.073;Gain 从 0.319 分别降到 0.109、0.019 和 0.016。
与开放世界模型相比,Memorizon 与 CaR 是仅有的两个具有清晰记忆的系统,Memorizon 在八个记忆列中领先五个,并在中途路径返回上占优。 论文用 Gain 列扣除同一视频任意两帧在相同时间间隔上本就共享的相关性,从而把“重访一致性”与“普通帧间一致性”区分开。 论文报告其他五个基线在起始位姿的 Gain 至多为 0.075,LingBot-World 2.0 为 0.006,而 Memorizon 为 0.230、CaR 为 0.220;论文同时说明 Memorizon 未在 VBench 各列领先,并给出相机跟随相关性检查以排除“只是相机控制更好”的解释。
启示与展望
该配方面向以相机运动为主、场景静态的流式世界模型训练:论文明确说明主要关注静态场景,除相机外没有物体运动,因此重访总是回到应当看起来相同的地点。适用对象是使用分块因果扩散变压器、能获得相机位姿与内参、并希望以有界序列长度监督长跨度重访的训练流程。检索判据需要相机位姿,位姿距离项与视锥重叠的深度范围都带有场景尺度,论文说明其语料共享同一米制单位缩放,并给出尺度敏感性测量。跨度被定位为覆盖度设置:一旦覆盖重访的首次访问,继续加长只增加没有 chunk 会选中的候选。
论文报告图像质量随跨度增长而下降,并把原因追溯到训练时条件于干净真值、推理时条件于模型自身输出这一暴露偏差,蒸馏在多大程度上缩小该差距仍有待测量。跨度超过约一分钟的收益无法由论文的评分窗口区分,论文改用把网络照片 rollout 到更长时长并按访问间隔分箱的方式评估,并说明超过四分钟间隔的返回样本很少、最后一箱最不确定。记忆库编号为时间顺序而非共享索引在像素重访上更高、在特征重访与图像质量上并不一致占优,哪种索引更合适仍属开放问题。检索判据不建模遮挡与沿视线方向的运动,论文在附录中明确列出这两点。此外,本证据包为全文文本,未包含图表本身,涉及具体图表数值的细节以正文叙述为准。
