跳到主要内容
返回时间线
arXiv来源发表:

V-CoLA 用线性注意力内在信号压缩视觉 token,保留 12.5% 仍达 88% 性能并获最高 6.15 倍预填充加速

核心概要

作者提出免训练的视觉 token 压缩框架 V-CoLA,针对含线性注意力的混合视觉语言模型,从线性注意力有界循环状态的保留偏好中导出唯一性感知的重要性准则,并配合自适应分块合并与深层视觉 token 提前退出;在 Qwen3.5-9B 等模型上,保留 50% 视觉 token 时达到原性能的 99.5%,保留 12.5% 时仍超过 88.0%,预填充加速 1.86 至 6.15 倍。

Source-provided article image: V-CoLA: Vision Token Compression with Linear Attention
Figure 1 ·

Figure 1: Comparison of token selection. FastV suffers from attention bias, missing the digits at the top of the image. DART selects pivot tokens from only sparse semantic regions, leading to insufficient awareness of some primary objects. Our method successfully identifies all main regions and provides an accurate response.

arXiv

深度剖析

论文系统分析了既有视觉 token 压缩方法在含线性注意力的混合架构上的结构性失效:注意力类与相似度类方法在迁移到混合架构后,表现几乎不超过随机剪枝基线。 此前方法多依赖 softmax 注意力分数或隐特征相似度,并主要在 softmax 注意力模型上评估;本文指出混合架构中浅层注意力集中度与隐特征可区分性均被改变,需要新的重要性信号。 基于多基准对比实验(图 2)、Qwen3-VL 与 Qwen3.5 各深度注意力分布对比(图 3)以及 DART 冗余 token 选择分析(图 4)给出定性证据。

论文提出唯一性感知的重要性准则,将每个 token 对最终状态的长期贡献与其相对历史上下文的短期唯一性加权结合,用于识别关键视觉 token 并避免冗余。 相较仅用状态更新幅度的做法,该准则同时考虑长期信息保留与短期冗余抑制,并从线性注意力的重构目标出发定义重要性。 由重构误差与伪查询探测的状态变化度量构成,权重参数经消融实验比较,默认设置在不同模型规模与架构族上取得最佳结果。

论文提出自适应分块合并策略,按重要性分布密度将 token 划分为重要性均衡的块并在块内合并,使重要区域获得更细粒度压缩。 相较聚类或二分匹配等聚合方法,该策略显式考虑重要性分布,从而在不同语义区域自适应分配压缩率。 消融实验显示移除自适应合并会带来性能下降,且通过调节温度系数可模拟硬剪枝,提供使用灵活性。

论文实现与线性注意力分块并行兼容的优化,并加入深层视觉 token 提前退出机制,在保持多模态推理性能的同时显著降低预填充开销。 扩展 Gated DeltaRule 支持多查询注入,使伪查询探测可在分块并行下完成;提前退出将深层冗余 token 预算重新分配给浅层视觉理解。 自适应 token 合并仅增加 0.86ms 开销,约占预填充总成本的 0.1%;扩展 Gated DeltaRule 在 4 查询推理下取得 3.85 倍加速;提前退出在 V*-Bench 上验证了中间层视觉访问的价值。

启示与展望

该结果面向交错线性注意力与 softmax 注意力层的混合视觉语言模型,如 Qwen3.5 与 InfiniteVL,适用于需要在预填充阶段降低视觉 token 开销的多模态推理场景。方法为免训练,可直接叠加在已有模型之上,默认配置在 Qwen3.5-9B、Qwen3.5-27B 与 InfiniteVL 上均取得最佳结果,无需逐模型调参。对于具有兼容矩阵状态读出的循环骨干,两个准则仍然有定义,将评估扩展到此类骨干是自然的后续方向。

评估主要覆盖交错线性注意力与 softmax 注意力的混合视觉语言模型,纯 Mamba 或全线性注意力视觉语言模型尚未纳入实验,将方法扩展到这些架构可能需要重新审视唯一性感知准则与缺少周期性 softmax 注意力层之间的相互作用。分析与方法设计主要基于 Gated DeltaNet 形式,更广泛线性注意力形式的系统性研究有助于评估该准则的通用性。此外,正文中部分公式与图表的数值以占位形式呈现,若需复现具体系数与曲线细节,仍需查阅原文图表。

来源