GEAR 把几何当作记忆地址:用稀疏对应注意力把 ATE 降低 80.3%,实现分钟级相机可控视频生成
核心概要
该工作提出 GEAR 框架,不再把历史观测融合成持久全局 3D 表示,而是用逐帧几何建立 token 级历史—目标对应,把几何当作视觉记忆的显式地址,再由 Geometric Correspondence Attention 只对几何匹配的历史特征做稀疏注意力注入,并用 Invisible Octree 剔除可投影但被遮挡的对应;在 DL3DV-Evaluation 与 WorldScore-Static 上报告了最优的视觉质量、相机控制与重访一致性,支持分钟级长时程生成。
深度剖析
GEAR 把几何与视觉记忆解耦:几何只回答“从哪里读”,注意力回答“读什么”。 此前方法要么在隐式历史上下文上做稠密注意力搜索,要么把历史融合成持久 3D 记忆再重投影;GEAR 保留历史帧 latent,仅用逐帧几何建立 token 级对应,使几何成为“瞬时地址”而非持久场景状态。 论文以方法设计与消融支撑该主张:去掉 GCA 的残差注入后时序稳定性与相机运动一致性下降;把对应受限注意力换成对完整历史上下文的稠密注意力后,相机控制与视觉保真度同样退化。
Geometric Correspondence Attention 让每个目标 token 只访问几何匹配的历史 token 作为 key/value,并在去噪过程中以残差分支注入。 与 UCM 的位姿编码 warp、Lyra 2.0 的对应坐标嵌入相比,GEAR 直接限制每个目标 patch 只能关注其匹配的历史 patch 集合,从而直接访问历史视觉特征本身。 GCA 插入每个偶数索引 DiT block,隐藏维度 640,共 262M 参数,仅占骨干的 1.9%;骨干参数冻结,只训练 rank-32 LoRA 与 GCA,共 10K 迭代。
Invisible Octree 累积可见性证据,剔除“几何上可投影但在目标视角被遮挡”的对应。 仅靠跨视角投影会产生假对应;该八叉树只存可见性、不存外观,也不作为渲染条件,只提供粗粒度二值过滤。 消融显示,在大视角变化下,可投影但被遮挡的对应不仅引入局部外观错误,还会通过自回归历史传播结构性不一致;加入该模块可抑制这种误差传播。
在 DL3DV-Evaluation 与 WorldScore-Static 上,GEAR 报告了最优的视觉质量、相机控制精度与重访一致性。 相比最强基线,ATE 降低 80.3%;在 WorldScore 上取得最佳 Content Alignment、Photometric Consistency、Style Consistency 与重访表现(Revisit SSIM 0.6489、Revisit LPIPS 0.2019)。 DL3DV-Evaluation 上 SSIM 0.3645、LPIPS 0.4459、FVD 837.59、TransErr 0.0116、RotErr 0.1228、ATE 0.0436;WorldScore-Static 使用 50 个随机采样场景与闭环相机轨迹,重访指标在匹配相机位姿下与参考观测比较。
启示与展望
该结果面向长时程、相机轨迹可控的自回归视频生成场景,尤其是需要重访已观测区域的闭环轨迹;方法依赖外部 3D 模型(Depth Anything 3)估计相机位姿与逐帧深度,并需要帧对齐的 VAE 编码以保证 latent token 与相机位姿一一对应。对使用者而言,这意味着可以在冻结的预训练视频骨干上以轻量适配获得细粒度历史记忆访问,而不必构建持久全局 3D 表示。
论文自述仍依赖外部 3D 模型做深度估计,带来额外计算开销,并把“在生成模型内联合学习几何与记忆寻址”列为未来方向。消融中的对应扰动实验只保留 9 个观测中的 2–3 个有效观测、其余扰动 64–128 像素,这一设定下的鲁棒性结论能外推到多强的深度误差仍有待观察。此外,评测中的相机尺度对齐、基线深度替换与动作离散化等协议差异,会影响跨方法比较的解读;本总结基于论文正文与附录文本,未包含图表与视频结果本身。
