SemanTok 让视频 token 前缀先装语义:201M 自回归模型追平 3.4 倍大的 VideoFlexTok
核心概要
SemanTok 是一种灵活长度视频 tokenizer,把冻结 DINOv2 特征送入编码器并用轻量头从每个保留的 token 前缀重建这些特征,使 201M 自回归模型在保真度上追平或超过 3.4 倍大的 VideoFlexTok 模型,并在所有噪声水平(含纯噪声)下提升语义对齐。
深度剖析
SemanTok 在编码器输入中融合冻结 DINOv2 特征,并新增稠密与类别两个交叉注意力头,仅从保留的 token 前缀重建 DINO 特征,从而让每个前缀都携带教师语义。 此前的灵活 tokenizer(如 VideoFlexTok)只在早期解码器隐状态上施加 REPA 损失,而该解码器还能从带噪潜变量部分满足目标;SemanTok 的辅助头不看带噪潜变量,只有 token 能降低其损失。 论文在 Kinetics-600 与 uCO3D 上以相同码本、序列长度和 AR 配方对比 VideoFlexTok,并给出七种 AR 规模(49M–2.29B)与多个 token 预算的结果。
语义对齐与保真度在每个 AR 规模上均优于同尺寸 VideoFlexTok:Kinetics-600 上 gFVD 降低 11–24%、gFID 降低 5–17%、类别准确率提升 25–61%,uCO3D 上分别改善 2–13%、5–8%、22–30%。 增益在最小 AR 模型上最大,说明语义监督把内容决策前移到前缀,缓解了容量稀缺时的误差累积。 Kinetics-600 每格 2,048 段生成视频,uCO3D 每划分 2,560 段,并给出配对 bootstrap 区间;在固定预算下 85M SemanTok 在 gFID 上超过所有尺寸的 VideoFlexTok。
SemanTok 的前缀更便宜预测:201M 模型下每 token 交叉熵低于 VideoFlexTok,且前 4 个 token 的类别准确率接近 VideoFlexTok 前 32 个 token,像素细节被推迟到后续 token。 这给出前缀层面的压缩—生成权衡:语义早放、细节后置,使小模型也能先定内容。 交叉熵在 1,024 段验证视频上测量,token 重复统计基于 60k 训练片段,显示节省并非来自重复。
在纯噪声输入下,SemanTok 解码器 REPA 读出在所有噪声水平上语义对齐更高,且在 uCO3D 的分布外类别上保持语义对齐。 说明语义确实来自 token 前缀而非带噪潜变量,并扩展到训练中未见过的类别。 噪声扫描使用 256 段验证视频与相同噪声种子;OOD 结果基于 uCO3D 的 ID/OOD 划分,201M AR 模型在 OOD 类别上提升生成类别准确率。
启示与展望
该结果面向使用灵活长度、粗到细视频 tokenizer 的自回归视频生成与世界模型场景:应用方在推理时选择 token 预算,小 AR 模型先确定片段内容,大模型再补外观细节。论文在 Kinetics-600 的类别条件与 uCO3D 的文本条件上验证,并给出 49M–2.29B 的 AR 规模阶梯,因此可直接用于按算力预算选模型的工程决策。作者也指出后续方向包括直接优化可预测性、用视频原生或语言对齐的教师组织前缀,以及把这类前缀当作动作条件世界模型的紧凑状态。
论文自述在低 token 预算下优先语义对齐而牺牲颜色与外观细节的重建,且单 token 每帧时多项目标难以同时满足;uCO3D 在 66B token 后出现过拟合,Kinetics-600 的 tokenizer 在 131B token 时仍在改善。此外,附录中的噪声探针无法把编码器 DINO 输入、类别 token 注入与前缀 DINO 目标三项改动彼此分离,因此各项贡献的相对大小仍是开放问题。首页证据包中的表格数值在抓取时大量缺失,具体数字需回到原文核对。
