在原始视频上对语言模型做中期训练,视频基准平均提升2.9分、图像基准提升5.1分且文本能力不降
核心概要
该工作研究能否用无字幕、无文本损失的原始网络视频对预训练语言模型做中期训练:将视频帧编码为连续视觉token,让模型预测下一个视觉token,在YT-Temporal-1B的原始片段上中期训练Qwen3-1.7B,再与未做中期训练的模型施加相同的图文指令微调;结果视频基准平均提升2.9分、图像基准提升5.1分,文本平均分由48.0升至48.9,且预测字幕并不优于预测视觉token。
Figure 1: Overview of continuous video mid-training. Ordered video frames x 1 : T x_{1:T} are encoded and projected into continuous token representations. Spatial patch grids are serialized with row-delimiter tokens and concatenated into a unified sequence V V . A causal language model processes the continuous visual stream without captions or text supervision, and a prediction head r ω r_{\omega} regresses the subsequent visual representation v i + 1 v_{i+1} from the hidden state h i h_{i} . A stop-gradient operator sg ( ⋅ ) \operatorname{sg}(\cdot) is applied to the regression target so that gradients do not flow through it.
arXiv深度剖析
提出一种无需字幕与标注的中期训练目标:把每帧经视觉编码器与投影器映射为连续视觉token,按行主序序列化并加入换行嵌入,让因果语言模型在token空间做自监督特征回归,预测下一个视觉token。 此前多模态工作要么从零联合训练统一Transformer,要么在精选视频片段上加潜在未来帧预测头;该工作改为对已有预训练LLM做继续预训练,且不使用离散视觉码本或语言监督。 目标函数为预测表示与真实视觉token之间的余弦距离,并对目标施加stop-gradient,使梯度只经因果预测通路传播;该单一目标在因果自注意力下同时覆盖帧内空间下一patch建模与跨帧时间预测。
视频中期训练同时提升视频与静态图像理解:四个视频基准平均提升2.9分,其中EgoSchema提升4.8分;十个图像基准全部提升,平均5.1分,ChartQA提升8.2分、DocVQA提升6.4分、AI2D提升6.1分。 增益从视频迁移到静态图像,且集中在文本密集与图表类任务,说明连续视觉token的预测式中期训练带来的表征可跨模态复用。 对比条件为同一图文指令微调流程,唯一差异是是否做视频中期训练;训练在128块NVIDIA H100上端到端进行一个epoch(27,300步),有效批大小256个片段,上下文窗口16k token。
尽管中期训练不含任何文本,文本能力得以保持:14个文本基准平均分由48.0升至48.9,知识与常识类各分数与未中期训练模型相差不超过1.4分。 与需要混入纯文本数据来缓解语言能力损失的常见做法不同,这里仅用图像-文本指令数据,中期训练后的模型在GSM8K、MATH500、BBH上的下降反而更小(分别下降18.6、16.5、9.5分,而未中期训练模型分别下降23.5、17.7、15.0分)。 文本评测覆盖常识与世界知识、数学与多步推理、代码生成;作者提出一种可能解释是中期训练已让语言模型适应视觉token,指令微调需要改动的更少。
预测字幕并不优于直接预测视觉token:下一帧字幕目标在视频与图像上得分相近,但文本平均分低1.5分;当前帧字幕在图像理解上落后视觉token 5.0分。 这表明视频中期训练可以完全自监督,无需昂贵的逐帧字幕流水线,也避免自动字幕带来的标注噪声。 字幕基线由Qwen3-VL-30B-A3B以进度感知提示成对生成;在控制训练预算、与0.5 epoch视觉模型(视频52.37、图像53.76、文本48.32)比较时,视觉下一token预测在视觉增益上相差0.3分以内,同时更好地保留文本能力。
启示与展望
该结果面向以预训练因果语言模型为起点、再经图文指令微调的多模态流程:在此设置下,用YT-Temporal-1B的16帧原始片段做中期训练即可带来视频与图像增益,并保持文本水平。方法上只需在中期训练期间增加一个小型预测头,不需要离散码本或语言监督,因此可扩展到大型网络视频集合而无需标注。作者指出,下一步需要检验更密集的时间采样或更长序列视野能否带来进一步提升,并在更大语言模型上评估这些动态,以判断无字幕视频中期训练能否成为多模态指令微调的标准前置阶段。
增益在训练前0.3个epoch(19.5B视觉token)内即出现,此后0.7个epoch内变化小于0.5分,因此更长时间训练是否还有收益尚不清楚。作者也指出,这些增益究竟来自时间结构还是仅仅来自更多视觉token曝光,需要未来的帧打乱实验来区分。文本方面,两个模型在GSM8K、MATH500、BBH上均低于原始语言模型,且中期训练模型在BBH上5.5分的优势小于同一初始状态两次指令微调之间11.7分的差异,因此该文本保持效应的稳健性仍需观察。此外,推理类基准在不同评测间隔波动可达9分,读者在解读单点分数时应留意这一波动范围。
