跳到主要内容
返回时间线
arXiv来源发表:

LOCI 用相机几何条件化的线性记忆加历史 KV,在 MIND 记忆基准上把重访 PSNR 提到 14.36 dB,并以恒定 23.6 GiB 流式生成 300 秒视频

核心概要

LOCI 提出一种混合空间记忆架构:在 30 个 transformer 块中的 15 个保留历史观测的键值缓存,另外 15 个只关注当前块并辅以一个由投影相机几何条件化读写的循环线性注意力记忆,循环读出会流入后续缓存块并为它们的查询提供累积场景上下文;在公开 MIND 记忆基准和留存的录制轨迹上,它比代表性世界模型和同配方全 softmax 模型更忠实地复现重访内容,全历史下等长度峰值内存降低约 30%,在有界观测库下以恒定内存流式生成长视频。

AI-generated editorial illustration: LOCI: Spatial Linear Memory for Streaming World Models

深度剖析

LOCI 把两种记忆表示放在同一网络里:一半块保留历史观测的 KV 缓存以保存观测级细节,另一半块用固定大小的循环线性注意力状态压缩全部历史,且该状态的读写由 PRoPE 投影相机几何条件化,使视角同时进入记忆寻址与存储内容。 此前显式记忆世界模型靠视场重叠、surfel 索引或查询—键相似度挑选历史观测,局部—全局架构则把历史压缩进固定状态而丢失场景细节;LOCI 让循环读出加到后续层的 token 特征上,由这些特征形成历史注意力块的查询,从而让压缩历史引导对保留观测的访问,无需单独的状态到查询适配器或路由器。 论文在 5B Wan2.2-TI2V-5B 骨干上训练 5,000 次更新,循环分支增加 90.7M 参数(占 5.38B 的 1.7%);对照实验显示,在相同有界 KV 预算下混合模型比同配方全 softmax 在 MIND 上 PSNR 高 0.89 dB,并在 50 段中的 44 段更好。

在 MIND 记忆基准上,LOCI 零样本取得比在 MIND 上训练的 GIM-World 更低的 MSE 和更高的 PSNR、SSIM,并在所有被完整评分的流式世界模型中四项指标最优。 论文报告 LOCI 的 MSE 0.0455、PSNR 14.36、SSIM 0.464、LPIPS 0.643,而 GIM-World 报告值为 0.0614、13.40、0.414、0.630;在作者实际运行的流式模型中,LOCI 比最强的 HY-WorldPlay 高 1.82 dB PSNR,且这些外部模型中有多个规模更大(8–28B)。 评测遵循 MIND 官方协议并覆盖整个预测片段,区间为按片段聚类的 95% bootstrap 区间(10,000 次重采样);作者说明外部模型在规模、训练数据、采样步数和记忆段接收方式上不同,因此该比较是在统一协议下的参考,受控比较由同配方消融给出。

有界稀疏模式下,LOCI 用固定容量观测库加循环状态在恒定内存中流式生成 300 秒视频,并在相同预算下仍比全 softmax 更忠实。 稀疏模式保留一个条件帧 sink、最近 8 帧和一个最多 20 帧的全景库,softmax 最多看到 34 个潜帧;被丢弃的观测不归档,但循环状态继续携带其信息,因此显式存储与循环状态都不随视频长度增长。 论文报告有界稀疏下 300 秒运行占用恒定 23.6 GiB,比同访问方式的全 softmax(27.6 GiB)少 15%,速度相同(单张 H200 上均为每视频秒 5.4 秒);在录制轨迹上,有界稀疏的重访 PSNR 11.21 dB、LPIPS 0.547,甚至略高于全历史设置。

循环状态确实承载相机可解码的场景信息,并影响下游历史注意力的分配:相机偏航可从累积状态线性解码,且 LOCI 的历史注意力更集中于共视内容。 论文用 PRoPE 把相机几何写入循环键和值,并检验偏航相对首帧是否仍可线性解码;同时通过回放同一段真值历史比较两个模型在同一查询位置的注意力,测量共视 token 获得的注意力份额。 从第 9 个块起在每个块边界读取状态(32 条设计轨迹、15 个混合层平均、按轨迹聚类的交叉验证与 bootstrap),得到留出 R² 0.951、中位误差 3.6°;共视 token 仅占历史约 0.1%,LOCI 的 15 个 softmax 层把 11.1% 的历史注意力放在其上,全 softmax 为 10.45%,8/8 片段一致;在各自 rollout 上 LOCI 对共视区域的重建也更接近(掩码 LPIPS 0.597 对 0.654,154 个时刻中 131 个更低)。

启示与展望

该结果面向需要相机可控、长时程流式生成且要求重访一致性的视频世界模型研究与应用,适用场景是渲染或录制轨迹上的重访保真度评测,以及有界显式存储下的持续生成。它使后续工作可以在不随视频长度增长的历史存储下继续扩展生成时长,并把相机几何作为记忆寻址的显式线索;对使用同类混合注意力骨干、需要保留观测级细节的团队,这套“循环状态加保留 KV”的组合提供了可直接借鉴的层间交互方式。论文的留出轨迹在 Unreal Engine 中渲染,真实世界拍摄未纳入评测,因此结论适用于所评测的渲染与基准设定。

所有模型的绝对保真度都偏低(基准平均 PSNR 低于 15 dB),因此增益应作为相对比较来读;研究只覆盖一个 5B 骨干和 5,000 次更新的较短微调预算。两个模型在全部 30 个块中都保留显式历史的相机注意力分支,所以循环路径是把主注意力 KV 减半而非把全部存储历史减半。训练时循环状态由加噪块特征构建,推理时由生成块提交,这一差异对长时程行为的影响值得继续观察。每 token 保留与每块保留的对比使用了在短程比较之后定义的扩展指标,属于探索性结果。有界稀疏模式与全 softmax 的速度持平依赖论文所述的优化实现。此外,本次读取的文本在部分表格与区间数值上存在缺失,若需引用具体置信区间与逐项数值,应回到原文核对。

来源