反转视频帧序后模型答案不变:研究者定位到中间层的时间信号峰值,并用免训练注入把它补回后续层
核心概要
该工作定义“时间发散向量”τ_l(反转帧序引起的逐层表示差异),在 Qwen2.5-VL-7B、Qwen3-VL-8B、InternVL2.5-8B 上发现其归一化幅度在中间偏后层达到峰值、随后向输出层递减,并通过问题条件分析与注意力敲除确认该峰值对时间推理特异且对预测功能关键,据此提出免训练的 Temporal Activation Injection(TAI),在峰值层提取 τ_l 并按测得的衰减曲线注入后续层,在三个 VideoLLM 与四个基准上一致提升时间推理且对非时间任务影响可忽略。
深度剖析
论文提出时间发散向量 τ_l 及其逐层 profile:把每个视频与其帧序反转版本配对,两者空间内容与文本条件相同,因此隐状态差异只隔离出时间顺序的贡献;在三个模型上归一化幅度都呈现“中间层上升、中间偏后层达峰、之后向输出递减”的一致形状。 此前工作(如 T3、ArrowRL)指出 VideoLLM 的时间推理瓶颈在语言模型侧或输出层不敏感,但没有刻画信号在层内如何演化;该工作把“时间信息在哪一层最强、之后如何衰减”变成可测量的逐层曲线。 基于 50 对来自 TempCompass 的反转视频对与二元时间问题,在 Qwen2.5-VL-7B、Qwen3-VL-8B、InternVL2.5-8B 三个不同视觉编码器、语言骨干与位置编码的模型上取平均;profile 在仅 5 对样本时即出现峰后衰减形状,与 50 对 profile 的 Pearson 相关超过 0.95。
该峰值被验证为时间推理特异且功能关键:保持视频对不变、只更换问题,非时间问题(空间问题、与视频无关问题)下峰值显著减弱;对最后一 token 做逐层注意力敲除时,敲除峰值附近层造成的正确答案概率下降最大。 这区分了“反转带来的所有表示差异”与“真正服务于时间推理的子集”,把 profile 从描述性曲线升级为可定位干预点的诊断工具。 问题条件分析在同一视频对上比较三类问题;功能验证用注意力敲除在全部层上扫描,并以时间相关子任务的正确答案概率变化为指标,敲除区域与 profile 峰值对齐。
据此提出 TAI:在 profile 峰值层提取 τ_l,按 profile 测得的逐层衰减作为注入权重,把该向量加回后续层的最后一 token 隐状态,强度由每个输入自身的 τ_l 幅度调节,无需训练、无需标注、不修改模型权重。 与对比解码类方法(TCD、VTD、SEASON)在输出分布层面干预、以及需要标注数据学习转向向量的方法不同,TAI 在中间表示层干预,且注入方向与调度都来自模型自身测得的量,只留一个全局缩放系数作为自由超参。 消融显示 profile 引导的调度优于均匀调度与反向调度(TempCompass 平均 75.6 对 75.4、75.1,基线 73.4);从峰值层提取增益最大,早于峰值层几乎无提升;单层提取最好,窗口放宽到多层仅缓慢退化。
在三个 VideoLLM 与四个基准上,TAI 一致提升时间推理且对非时间能力影响可忽略:TempCompass 平均从 73.4/77.1/70.9 提升到 75.6/78.0/73.6,TVBench 从 44.6/49.9/57.2 提升到 46.6/52.6/58.3,AoTBench 从 54.5/56.6/54.6 提升到 57.7/59.9/56.6;MVBench 上时间相关组提升、时间无关组与混合组仅小幅波动。 免训练方法中 TAI 取得最高平均,并在 Qwen2.5-VL-7B 上接近需要强化学习与专门训练的 ArrowRL;把 TAI 叠加在 ArrowRL 训练后的权重上仍有额外增益,说明激活层干预与权重层优化互补。 所有数字来自同一硬件与 16 帧协议下的自测;反转符号的 Anti-TAI 对照使反转敏感类别(Attribute Change 降 36.3%、Order 降 27.4%、Direction 降 12.6%)显著退化,而反转不变类别(Action、Speed)保持在基线 1% 以内;帧采样与提问措辞扰动下增益经 McNemar 检验仍显著。
启示与展望
该结果面向需要帧序信息的时间推理任务,例如事件排序、方向性运动与随时间变化的属性,适用于暴露中间表示的 decoder-only VideoLLM,并可在推理期直接叠加到已有权重之上;profile 只需一次性按模型估计并复用,无需逐域重校准。作者指出,工作聚焦于帧序带来的时间信息,空间推理、物体交互与音视频对应等视频理解的其他方面不在范围内,但框架原则上可通过设计帧序反转之外的对比对来扩展到其他变化轴。
profile 与注入调度由 50 对 TempCompass 反转视频对估计,虽然换用其他基准视频估计后精度几乎不变,但在更长、事件更密集或领域差异更大的视频上是否同样稳定,正文未给出结论。TAI 的增益在时间相关类别上明显、在反转不变类别上接近零,因此对答案不依赖帧序的任务预期收益有限;Direction 类别内部差异较大,作者以类别内异质性解释其较小的平均 τ_l。自由形式生成只做了定性观察(日出与日落视频),未给出量化评测。此外,本总结依据的是论文正文与附录文本,未包含图与表的原始图像,涉及曲线形状与可视化示例的判断以文中文字描述为准。
