跳到主要内容
返回时间线
arXiv来源发表:

TrackEverything 用体素去重把稠密 3D 点跟踪推到 1000 帧以上,短片段 APD 比开源全帧稠密跟踪器高 20% 以上

核心概要

TrackEverything 把视频表示为世界坐标系下持久化的 3D 场景轨迹,通过滑窗边界上的体素化去重、先端点后轨迹的分解以及 3D WAFT 特征采样,在 40 GB 显存内首次实现对超过 1000 帧视频中全部可见点的稠密 3D 跟踪,在 TAPVid-3D 短片段上比所有开源全帧稠密 3D 跟踪器高出 20% 以上 APD,并在长序列上与最先进稀疏跟踪器保持竞争力。

AI-generated editorial illustration: TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations

深度剖析

提出 TrackEverything,一个在世界坐标系中把视频表示为持久 3D 场景轨迹的 3D 点跟踪器,据作者所述是首个能在 1000 帧以上视频中跟踪全部可见点的 3D 跟踪器,并在 40 GB 显存内运行。 此前稀疏跟踪器只能跟踪用户指定的少量查询点,稠密跟踪器要么只跟踪首帧可见点,要么被限制在 48–64 帧的短片段;该工作把模型复杂度与视频时长解耦,改为随场景中独特物理几何增长。 论文在 TAPVid-3D 官方 minival 划分(ADT、DriveTrack、PStudio 各 50 段)上评测,并报告在 PointOdyssey 1000+ 帧全长视频上 APD-P 31.8、APD-M 74.5、静态/动态准确率 91.2%;该设置下无基线可运行,因此没有定量对比。

提出滑窗边界上的体素化去重机制:当不同帧的点收敛到同一物理表面、占据相同 3D 坐标时被合并为单一规范轨迹,避免同一表面的重复观测不断累积。 以往 3D 跟踪方法的内部特征云为每一帧保留完整点网格,内存随视频时长线性增长;该机制让表示规模随独特物理几何而非帧数增长。 体素尺寸消融显示,不做体素化时模型很快 OOM,而精度在细体素到某一尺寸之间保持稳定(31 APD-P),更粗的体素提升速度并降低峰值内存;默认体素尺寸在保持峰值精度的同时把延迟和内存减半。

把跟踪分解为端点精炼器与轨迹精炼器:端点精炼器预测每个点在窗口末端的目的地并判定静态/动态,轻量轨迹精炼器只对动态点解码稠密轨迹;同时提出 3D WAFT,用场景云中的高效特征采样替代内存开销巨大的 4D 相关体。 静态点在世界坐标中不动,这一分解把稠密解码集中在少量运动表面上;3D WAFT 把 WAFT 扩展到 3D 点云,用投影位置上的模板匹配取代 4D 相关。 消融显示,强制所有点走动态轨迹解码器时跟踪精度不变(APD-P 相同),但延迟和峰值显存上升;移除迭代轨迹精炼使 APD-P 从某一数值降到另一数值,移除 3D WAFT 特征采样同样使 APD-P 下降。分类器在 Dynamic Replica 与 PointOdyssey 上可靠分割运动物体。

复杂度分析显示 TrackEverything 在视频长度和查询点数两个维度上都保持低延迟与低显存:900 帧时峰值显存仍低于 30 GB,而 Any4D 在 96 帧、SpatialTracker-v2 与 DeltaV2-dense 约 200 帧、DeltaV2-sparse 约 500 帧、CoTracker3 约 600 帧即超出显存。 此前稠密跟踪器在长视频上精度、延迟、显存三方面都不可扩展,稀疏 3D 跟踪器随查询点数增加延迟与内存快速上升。 在单张 L40S-46G 上以 PointOdyssey 验证集测量端到端推理时间与峰值显存,固定查询点数变化帧数、固定 120 帧变化查询点数;作者说明该实验重点在延迟与内存趋势而非绝对精度。

启示与展望

该结果面向需要在长视频中获取全部可见表面轨迹的场景,例如视频理解、机器人与动态世界模型;方法以滑窗方式处理视频,依赖相机位姿与深度(来自传感器或 VGGT 等前馈重建模型),因此适用于能提供或估计几何的设定。作者指出,模块化设计让模型可以无重训地受益于几何骨干与传感器硬件的进步;用户还可以通过非体素化的查询点分支保护重要点不被合并。在仿真数据有稠密真值时,作者在 PointOdyssey 与 Dynamic Replica 的留出划分上做了稠密跟踪评测。

体素化去重按窗口边界处的空间邻近性合并轨迹,且通过不可逆的均值池化执行,因此跟踪误差可能让不同物理表面永久合并为单一规范轨迹;作者把改进去重机制列为重要方向。作者还指出,在持续开放世界探索中活跃内存仍会增长,为小时级轨迹引入空间缓存淘汰是自然的下一步;性能仍与底层点图保真度耦合。此外,TAPVid-3D 只标注稀疏查询点,稠密真值评测限于仿真数据;D4RT 没有公开代码或权重、使用私有训练数据且只在 48 帧片段上评测,其对比数字仅作参考。本文档为完整正文,但表格以文本形式呈现,部分数值在解析中缺失,因此个别消融的具体数字无法在此复述。

来源