跳到主要内容
返回时间线
arXiv来源发表:

SemanTok 让视频 token 前缀先装语义:201M 自回归模型追平 3.4 倍大的 VideoFlexTok

核心概要

SemanTok 是一种灵活长度视频 tokenizer,把冻结 DINOv2 特征送入编码器并用轻量头从每个保留的 token 前缀重建这些特征,使 201M 自回归模型在保真度上追平或超过 3.4 倍大的 VideoFlexTok 模型,并在所有噪声水平(含纯噪声)下提升语义对齐。

AI-generated editorial illustration: SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

深度剖析

SemanTok 在编码器输入中融合冻结 DINOv2 特征,并新增稠密与类别两个交叉注意力头,仅从保留的 token 前缀重建 DINO 特征,从而让每个前缀都携带教师语义。 此前的灵活 tokenizer(如 VideoFlexTok)只在早期解码器隐状态上施加 REPA 损失,而该解码器还能从带噪潜变量部分满足目标;SemanTok 的辅助头不看带噪潜变量,只有 token 能降低其损失。 论文在 Kinetics-600 与 uCO3D 上以相同码本、序列长度和 AR 配方对比 VideoFlexTok,并给出七种 AR 规模(49M–2.29B)与多个 token 预算的结果。

语义对齐与保真度在每个 AR 规模上均优于同尺寸 VideoFlexTok:Kinetics-600 上 gFVD 降低 11–24%、gFID 降低 5–17%、类别准确率提升 25–61%,uCO3D 上分别改善 2–13%、5–8%、22–30%。 增益在最小 AR 模型上最大,说明语义监督把内容决策前移到前缀,缓解了容量稀缺时的误差累积。 Kinetics-600 每格 2,048 段生成视频,uCO3D 每划分 2,560 段,并给出配对 bootstrap 区间;在固定预算下 85M SemanTok 在 gFID 上超过所有尺寸的 VideoFlexTok。

SemanTok 的前缀更便宜预测:201M 模型下每 token 交叉熵低于 VideoFlexTok,且前 4 个 token 的类别准确率接近 VideoFlexTok 前 32 个 token,像素细节被推迟到后续 token。 这给出前缀层面的压缩—生成权衡:语义早放、细节后置,使小模型也能先定内容。 交叉熵在 1,024 段验证视频上测量,token 重复统计基于 60k 训练片段,显示节省并非来自重复。

在纯噪声输入下,SemanTok 解码器 REPA 读出在所有噪声水平上语义对齐更高,且在 uCO3D 的分布外类别上保持语义对齐。 说明语义确实来自 token 前缀而非带噪潜变量,并扩展到训练中未见过的类别。 噪声扫描使用 256 段验证视频与相同噪声种子;OOD 结果基于 uCO3D 的 ID/OOD 划分,201M AR 模型在 OOD 类别上提升生成类别准确率。

启示与展望

该结果面向使用灵活长度、粗到细视频 tokenizer 的自回归视频生成与世界模型场景:应用方在推理时选择 token 预算,小 AR 模型先确定片段内容,大模型再补外观细节。论文在 Kinetics-600 的类别条件与 uCO3D 的文本条件上验证,并给出 49M–2.29B 的 AR 规模阶梯,因此可直接用于按算力预算选模型的工程决策。作者也指出后续方向包括直接优化可预测性、用视频原生或语言对齐的教师组织前缀,以及把这类前缀当作动作条件世界模型的紧凑状态。

论文自述在低 token 预算下优先语义对齐而牺牲颜色与外观细节的重建,且单 token 每帧时多项目标难以同时满足;uCO3D 在 66B token 后出现过拟合,Kinetics-600 的 tokenizer 在 131B token 时仍在改善。此外,附录中的噪声探针无法把编码器 DINO 输入、类别 token 注入与前缀 DINO 目标三项改动彼此分离,因此各项贡献的相对大小仍是开放问题。首页证据包中的表格数值在抓取时大量缺失,具体数字需回到原文核对。

来源