StreamMAE 把 MAE 搬到连续视频流上:在 WT++95h 上 Cityscapes 达 74.0 mIoU,追平同数据 i.i.d. 预训练
核心概要
作者构建了 95 小时城市步行游览视频数据集 WT++,在严格滑窗、不打乱、不多轮回放的流式设定下评测 MoCo v3、DINO 与 MAE,发现对比与自蒸馏方法明显落后、MAE 更稳健但仍不及 i.i.d. 预训练,并通过受控实验把差距归因于批内高相似度而非批间相似度,进而提出保留 MAE 重建目标、加入流感知正则与运动偏置裁剪的 StreamMAE,使其超过流式基线、追平同数据 i.i.d. MAE,并随预训练流从 12 小时增至 95 小时持续提升。
深度剖析
在严格流式设定下,掩码重建比对比学习和自蒸馏更适合连续视频。 此前研究连续视频的工作多依赖预训练初始化、回放缓冲或放宽从零训练条件,本文则从随机初始化出发,用滑窗批次按时间顺序消费帧,不做全局打乱与多轮回放,并系统对比三类目标。 ViT-S/16 在 WT++12h 上全量微调:MAE 在 ImageNet-1K 达 77.1 Acc@1、Cityscapes 61.3 mIoU、ADE20K 23.9 mIoU,优于 DINO(72.7 / 53.2 / 23.9)与 MoCo v3(68.7 / 52.0 / 19.4),MoCo v3 甚至低于随机初始化(71.9)。
流式预训练与 i.i.d. 预训练之间的差距主要来自批内高相似度,而非批间相似度。 作者用一次预打乱的 ImageNet-1K 作为固定流,保留滑窗带来的高批间相似度但保持批内多样性,从而把两个因素解耦;这一受控设计此前未被用于该问题的归因。 DINOv2 特征统计显示 WT++12h 的批内相似度 μintra=0.665、批间 μinter=1.000,而预打乱 ImageNet-1K 为 0.004 与 0.989;预打乱流在 ViT-S 上达 77.4 Acc@1、63.6 mIoU、27.2 mIoU,与标准 i.i.d. MAE(77.4 / 64.0 / 26.9)基本持平。在 WT++12h 上把批内相似度从 0.665 降到 0.171 后,ViT-B 的 ADE20K 与 Cityscapes 分别提升 6.1 和 10.6 mIoU。
StreamMAE 在保留 MAE 重建目标的前提下,通过流感知正则与运动偏置裁剪缩小并基本消除流式差距。 方法不改动 MAE 的损失函数,而是改造输入管线:颜色抖动、提高 drop path、DataDrop、两阶段裁剪,以及基于相邻帧 patch 级 L1 差异的运动偏置裁剪选择。 ViT-S/16 在 WT++12h 上达 77.5 Acc@1、63.8 mIoU、26.1 mIoU,优于流式 MAE(77.1 / 61.3 / 23.9)并追平同数据 i.i.d. MAE(77.0 / 63.5 / 25.9);ViT-B/16 在 WT++12h 上达 81.1 / 69.0 / 32.7,Cityscapes 超过同数据 i.i.d. MAE 的 67.8。累积消融显示正则与裁剪选择贡献最大,DataDrop 增益较小。
性能随预训练流时长与模型容量增长,并可迁移到步行游览之外的多种视频域。 作者把 WT++ 从 12 小时扩展到 25、50、95 小时的有序流,并在 HD-EPIC、CROWD、KrishnaCAM 三个不同域上重复对比流式 MAE、StreamMAE 与同数据 i.i.d. MAE。 ViT-B/16 从 WT++12h 到 WT++95h,ImageNet-1K 由 81.1 升至 82.0 Acc@1,Cityscapes 由 69.0 升至 74.0 mIoU,ADE20K 由 32.7 升至 36.5 mIoU;三个额外域上分割提升 1.6–5.8 mIoU、深度 RMSE 降低 0.042–0.531,其中 HD-EPIC 与 CROWD 上各项均达到或超过同数据 i.i.d. MAE。
启示与展望
该结果面向从随机初始化、按时间顺序消费帧、不做全局打乱与多轮回放的流式预训练设定,适用于具身智能体与边缘设备等数据天然顺序到达的场景。WT++ 为 95 小时、58 段公开城市步行游览视频,作者计划以 CC BY 4.0 发布元数据、来源链接与预处理脚本,其中 56 段可直接再分发。方法层面,StreamMAE 除运动偏置裁剪外并未显式建模时间动态,其收益在 ViT-S 与 ViT-B、12 至 95 小时流以及三个额外视频域上得到验证,可作为后续流式预训练工作的基线与起点。
作者自述的开放问题包括:除运动偏置裁剪外,StreamMAE 未显式建模时间动态;固定帧率下采样可能并非最优,因为视频中视觉变化速率差异很大,自适应时间采样值得探索;检查点平均目前只在评测阶段使用,尚未把长时程整合纳入预训练过程本身。此外,DataDrop 在 ViT-S 小规模下有小幅增益,但在 ViT-B 与更长流上贡献可忽略,其适用边界仍需在更多设定下观察。MemoryStoryboard 的复现是在 ViT-S/16 协议下的受控复现,作者也指出该方法的原始配置使用更大步长,可能还有优化空间。
