跳到主要内容
返回时间线
arXiv来源发表:

FlashGaze 在 ViT 编码前用四叉树动态规划剪枝视频 patch,在 Qwen3-VL-8B 上以 20% 保留率保住 LongVideoBench 98% 精度并降低峰值显存 1.8 倍

核心概要

FlashGaze 是一种免训练方法,在 ViT 编码前以像素空间差异作为信息损失代理,用四叉树动态规划在固定预算下联合决定 patch 的丢弃、合并与保留,从而同时削减视频的时空冗余;在 Qwen3-VL-8B 与 NVILA-8B-Video 上,它在多个视频理解基准上取得更高精度与更低首 token 延迟,并在 20% 保留率下保持 LongVideoBench 全输入基线 98% 的精度。

深度剖析

把冗余削减提前到视频输入阶段,在 ViT 编码之前完成 patch 选择,因此被丢弃的冗余内容不再进入编码器。 已有方法多在 ViT 内部或之后剪枝(如 ToMe、VisionZip、FastV),编码成本未被触及;AutoGaze 虽在编码前选择 patch,但依赖自回归网络与专门训练数据。FlashGaze 不引入辅助网络、无需训练。 在 Qwen3-VL-8B 与 NVILA-8B-Video 两个骨干、六个基准上评测;附录 D 的分阶段延迟显示 FlashGaze 的 pre-ViT 开销约 0.5 秒,而 AutoGaze 为 7.3 至 14.6 秒。

用像素空间差异同时度量时间冗余(当前 patch 与视觉记忆中历史 patch 的差异)与空间冗余(合并前后重建差异),并以四叉树动态规划在预算约束下联合优化丢弃、合并、保留三种动作。 把多尺度 patch 选择写成带 patch 数量惩罚的预算约束优化问题,用细-中-粗三层四叉树与子树代价合并求解,避免不同尺度候选重叠导致的独立选择冲突。 消融显示像素差异在 30% 保留率、768 帧下于 HLVid 与 LongVideoBench 分别取得 71.7 与 66.3,优于 patch embedding、SigLIP、LPIPS;四叉树动态规划的累计动作代价 1.96 低于随机、单尺度贪心与多尺度贪心,精度 71.7 最高。

在同等保留率下同时取得更高精度与更低延迟和显存,并把骨干扩展到更长、更高分辨率的输入。 在 LongVideoBench 与 HLVid 上,FlashGaze 在 50%、40%、30%、20% 各保留率下均取得最低 TTFT 与最低峰值显存;在 20% 保留率下保持 LongVideoBench 全输入精度 98%,峰值显存降低 1.8 倍,TTFT 相对原始模型加速 13 倍,其中 ViT 编码 5.4 倍、MLLM prefill 17 倍。 表 1 与表 3 给出两个骨干、多个保留率下的精度、峰值显存与 TTFT;表 2 显示把 Qwen3-VL-8B 扩展到 1536 帧、3840 分辨率后,六个基准精度均高于原始模型。

分析表明剪枝后视觉表征与全输入高度相似,且模型把更多注意力分配给动态视觉 token,细尺度 patch 落在信息丰富区域。 在 20 个 HLVid 视频上以最后一层 prefill token 为查询、按注意力权重聚合首层视觉 value 向量并计算余弦相似度;在 50% 保留率下统计动态 token 的归一化注意力。 注意力分析显示 FlashGaze 在各层对动态 token 的注意力持续高于原始模型,同时 HLVid 精度从 71.6% 提升到 73.2%;可视化显示静态背景片段保留率仅 10% 与 13%,而天空等低信息区域用粗尺度 patch、交通标志等细节区域保留细尺度 patch。

启示与展望

该方法面向视频输入阶段的时空冗余削减,适用于具备多尺度 patch 输入能力的 MLLM 骨干:Qwen3-VL 系列原生支持多尺度图像输入,可无缝接入且无需下游微调;NVILA-8B-Video 通过插值每帧及其位置嵌入到不同尺度来支持多尺度 patch。评测覆盖通用、长视频与高分辨率三类共六个基准,主对比使用 LongVideoBench、VideoMMMU 与 HLVid,并在 Qwen3-VL-8B 上比较不同保留率下的精度、峰值显存与 TTFT。延迟测量在单张 NVIDIA H200、batch size 为 1、BF16 精度下进行,统一使用 PyTorch 原生 SDPA 而非 FlashAttention,每配置预热一次后取三次连续运行的平均。对需要低延迟处理长时高分辨率视频的场景,这一结果意味着可以在相同硬件上换取更长上下文与更高分辨率。

四叉树动态规划在每帧上的求解开销与帧数、分辨率的关系,正文只给出 pre-ViT 阶段约 0.5 秒的合计延迟,未展开其随输入规模的增长趋势。像素差异作为信息损失代理在剧烈相机运动或全局光照变化下的表现,正文只提到用分块局部搜索缓解轻微相机运动,未给出更强运动情形的结果。视觉记忆以最近一次保留的 patch 更新,长时间遮挡后重现的内容如何被处理,正文未讨论。注意力分析基于 20 个 HLVid 视频与 50% 保留率,动态 token 注意力更高与精度提升之间的关联被表述为可能贡献,而非确定的因果机制。此外,正文中若干加速倍数在摘要与结论处显示为空白,具体数值需以表 3 与附录 D 的分阶段延迟为准。

来源