跳到主要内容
返回时间线
arXiv来源发表:

TT-VidT 把外观与运动拆成两条通路:在 24 组架构-目标配对中,只有 TT3D 加 Diff Compression 同时领先 Jester、SSv2、ARID 与 Diving48

核心概要

该工作提出 TT-VidT,用 DINOv3 初始化的 ViT-B/16 逐帧空间通路加一个紧凑的 Temporal Transfer Layer,并以 Diff Compression 从首帧外观锚点与逐帧运动 token 重建目标帧;在约 170M–190M 编码器规模、1.7M OpenVid 与 Moments-in-Time v2 片段、8 轮训练的匹配配方下,24 组架构-目标扫描显示只有 TT3D 与 Diff Compression 的组合进入最强运动敏感区间,最终比较中同时领先 Jester、Something-Something V2、ARID 与 Diving48 微调,且编码器 FLOPs 比 DisMo 少 48%、比 VideoMAE 或 V-

AI-generated editorial illustration: TT-VidT: Decoupling the Temporal Axis for Efficient Motion-Centric Video Pretraining

深度剖析

论文提出一套受控的视频自监督学习协议,把架构、目标、数据暴露、训练计划与参数规模固定在同一配方下,用 4 种编码器乘 6 种目标共 24 个单元做匹配比较,并配一个单帧 DINOv3 外观诊断来界定边界情形。 此前视频自监督学习的比较往往同时变动架构、目标、数据、计划与解码器容量,难以把运动优先的表征归因到某个具体的架构-目标选择;这里把变量压到架构与目标两轴上。 扫描在约 170M–190M 编码器规模、1.7M 片段、8 轮、约 13.6M 样本、约 425k 优化步的共享配方下完成,每个单元单次运行,规范单元另做多种子检查。

TT-VidT 由 TT3D 与 Diff Compression 组成:TT3D 在 DINOv3 初始化的 ViT-B/16 空间通路上加一个紧凑 Temporal Transfer Layer,把每帧空间 token 下采样后与运动 token 一起做块因果 3D 自注意力;Diff Compression 则用首帧空间特征作外观锚点、第 t 帧运动嵌入作帧特定信息载体来重建目标帧。 与 VTok 显式做特征相减再投影不同,这里的运动 token 是 Temporal Transfer 通路在重建目标下端到端学出来的直接输出,架构里没有内置特征差分;解码器仍交叉注意完整的空间特征,外观通路保持宽、运动通路保持窄。 方法在 TT1D 与 TT3D 两种实例上给出,时间注意力序列长度为 192 个 token,远低于全空间特征注意力的长度;编码器、Temporal Transfer Layer、解码器与运动 token 嵌入联合训练。

扫描显示增益来自 TT3D 与 Diff Compression 的配对而非任一组件:固定 TT3D 把 Diff Compression 换成 MAE,Jester 从 53.89 掉到 11.07、SSv2 从 18.28 掉到 4.98;固定 Diff Compression 把 TT3D 换成 ViT3D 或 DisMo,Jester 为 19.82 或 12.98、SSv2 为 6.57 或 5.53。 24 个单元中只有 ViT3D+MAE 与 TT3D+Diff Compression 在无增强条件下于 Jester 与 SSv2 上进入高区间,说明成功区域稀疏,且配对存在交互效应。 结论基于 Table 1 的无增强扫描,使用统一的 decS_imgnet 解码器与单次运行;ARID 上 ViT3D+MAE 以 24.37 领先,TT3D+Diff Compression 为 21.98,说明该数据集上格局更混合。

最终比较中 TT-VidT 是唯一同时领先 Jester、Something-Something V2、ARID 与 Diving48 微调的方法,冻结探针下 Jester 73.25、SSv2 25.92,端到端微调后仍领先最强基线 21.0 与 12.9 个点;运动反转探针显示它在被翻转或时间反序的 SSv2 镜像类片段上最多只在 1% 的片段保留原答案,而各基线保留 9%–43%。 领先不只体现在平均精度上,还体现在表征本身是否读取运动方向:单帧 DINOv3 对照在时间反序下 0.0 翻转、100.0 保留,验证了探针,也说明 Temporal Transfer 与 Diff Compression 把顺序盲的基底变成了方向最忠实的编码器。 最终比较覆盖 HMDB、ARID、IARD、Jester、SSv2、EK-V 动词分类的冻结注意力探针,加 Diving48 全量微调与 EK-V 预期;Jester 与 SSv2 的领先在 kNN、线性、MLP、层加权与注意力共六种探针下均成立,且九次 TT-VidT 测量中最弱的一次仍高于最强的 ViT3D+MAE 测量。

启示与展望

该结果面向在匹配小配方下研究视频自监督表征的研究者与工程团队:它说明在约 170M–190M 编码器规模、1.7M OpenVid 与 Moments-in-Time v2 片段、8 轮训练这一设定内,把外观锚点与紧凑运动通路解耦可以同时获得运动敏感性与效率,TT3D 的编码器 FLOPs 为 456.1 GF,约为 DisMo 的一半、不到 VideoMAE 的一半。对需要运动线索的下游任务,例如机器人、辅助感知、体育或技能分析、科学视频理解,这一操作点提供了更省算力的选择;对身份、物体与场景线索更重要的任务,论文明确把 HMDB51、IARD 与 EPIC-Kitchens 列为边界,VideoMAE 在 HMDB51 以 27.73 领先、DisMo 在 IARD 以 89.89 领先、V-JEPA 2 在 EK-V 预期上以 23.07 领先。作者也把后续方向写成可执行的下一步:把 TT3D 与 DisMo 式双重增强结合、测试更长预训练与更强数据混合、以及用 DINOv2 或 CLIP 等替代外观参照重做诊断。

读者仍需留意若干开放问题。研究自述限定在单一匹配配方、约 170M–190M 单一编码器规模,扫描单元多为单次运行,因此其画像应读作关于这一受控区间的证据,而非对所有数据规模或训练计划的断言。外观-运动诊断本身被作者描述为轻量观察,用单帧 DINOv3 注意力探针作外观参照,换成 DINOv2 或 CLIP 可能改变各数据集在图上的位置;Diving48 在冻结探针视图下位于对角线下方,其增益来自全量微调,因此被当作补充证据而非诊断点。IARD 的方差主要来自五个演员中留出哪一个,在固定演员划分下各模型水平接近。此外,TT3D 与 DisMo 式双重增强的组合、空间编码器的部分解冻、更丰富的时序读出,以及未裁剪或自我中心视频上的评测都尚未测试。本证据包为全文,但表格与附录中的逐项数值以正文引用为准,若需精确复现仍应回到原文表格。

来源