跳到主要内容
返回时间线
arXiv来源发表:

δ-Vision 用轻量 MLP 适配器重建逐层视觉记忆,在保留全部视觉 token 的同时把 FLOPs 降到 17.90%

核心概要

该工作通过低秩干预发现多模态大模型中视觉到文本的信息流集中在低维子空间、且逐层视觉状态可由轻量 MLP 高余弦相似度地预测,据此提出 δ-Vision:冻结语言模型主干,用低秩适配器直接构造每层视觉记忆并保留全部视觉 token 供文本检索,在 Qwen3-VL-4B 上取得 74.4 的平均分(保留 92.9% 未压缩性能),比最强 5% 保留率剪枝基线 DivPrune 高 9.1 分,在 Video-MME 上仅需未压缩模型 17.90% 的 FLOPs。

AI-generated editorial illustration: Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models

深度剖析

作者发现视觉信息对文本流的影响集中在低维子空间:在阻断视觉到文本注意力后,只恢复少数方向即可找回大部分丢失的准确率。 此前降低视觉开销的思路是剪掉冗余视觉 token,而该工作把问题从“哪些 token 可丢”转为“视觉影响的有效维度有多小”,并给出低秩干预证据。 基于对视觉到文本信息流的低秩干预实验,以及逐层视觉隐藏状态的谱分析:在 Qwen3-VL-4B 上视觉注意力输出保留 95% 谱能量只需 38.0–103.5 个方向,LLaVA-1.5-7B 上为 29.6–37.6 个方向,均远低于可用秩。

逐层视觉状态具有强可预测性:为每一层单独训练的轻量 MLP 能从初始视觉嵌入高余弦相似度、低重构误差地逼近 Transformer 演化后的状态。 这提示保留有用视觉信息未必需要在每一层反复做全维度的视觉状态计算,为“改变视觉状态如何构造”而非“保留哪些视觉证据”提供了依据。 以余弦相似度与重构误差作为逼近质量的度量,并在后续实验中用该预测替代真实视觉演化路径后仍保持较高下游准确率。

提出 δ-Vision:用低秩适配器(embedding adapter 从初始嵌入直接预测各层记忆,recurrent adapter 逐层递推更新)构造逐层视觉记忆,经冻结的 key/value 投影供文本查询读取,从而去掉视觉 query、视觉注意力输出与视觉前馈计算,同时保留全部视觉 token。 与剪枝类方法永久丢弃视觉证据不同,δ-Vision 保留每个视觉 token 的可检索性,只压缩其逐层演化的计算,提供了与序列长度压缩互补的效率维度。 在 Qwen3-VL-4B 上 embedding adapter 平均分 74.4、recurrent adapter 75.4,均高于 5% 保留率下最强剪枝基线 DivPrune 的 65.3;训练目标消融显示 Supervised-KD 达 74.4 且训练 34m53s,优于 SFT 的 68.9 与 OPD 的 74.0(4h38m08s)。

在图像、多图与视频基准上,δ-Vision 在可比或更低计算量下取得高于视觉 token 剪枝基线的准确率,并跨多个 MLLM 主干保持约 94–96% 的原始性能。 说明视觉记忆预测不是单一模型或单一模态的偶然现象,而是可迁移到不同规模与架构(含混合注意力)的通用机制。 单图 9 项基准平均 74.4;多图/视频上多模态训练后平均 52.0,超过最强 5% 保留率剪枝基线 50.2;跨主干在 LLaVA-1.5-7B、Qwen3-VL-30B-A3B、Qwen3.5-4B 上分别取得 61.9、78.6、71.6;效率上 FLOPs 为未压缩模型的 17.90%,总加速 1.30 倍、prefill 加速 1.50 倍。

启示与展望

该结果面向需要处理长视觉序列的多模态大模型推理场景,尤其是高分辨率图像与视频理解;适用对象是希望在不丢弃视觉 token 的前提下降低逐层视觉计算的研究者与工程团队。方法以冻结视觉编码器、多模态投影器与语言模型主干、只训练轻量视觉记忆适配器为前提,默认配置为 Qwen3-VL-4B 加 embedding adapter、瓶颈秩 128。它可与 token 剪枝叠加:在 50% 保留率下与 DART、DivPrune 组合仅下降约 1.2–1.3 分,说明两条效率轴针对不同冗余来源。层跳过实验进一步显示,去掉前 5 层与后 10 层适配器时平均分仅从 74.4 降到 73.3,FLOPs 从 17.90% 降到 15.64%,为按层分配适配器预算留出空间。

顺序低秩干预显示视觉依赖在深度上高度不均匀:Qwen3-VL-4B 中间层最敏感,而 LLaVA-1.5-7B 的敏感层分布更分散且随任务变化;混合注意力主干中,屏蔽全部 24 个线性注意力层的视觉写入影响有限,而只屏蔽 FA 第 11、15 层的视觉读取就造成明显下降。这种模型特定性意味着适配器预算的最优分配可能需按主干与任务重新标定。此外,多图与视频结果依赖额外构造的训练数据配方,单图训练的适配器在 MuirBench 上为 40.7、多模态训练后升至 45.5,说明数据构成对长视觉上下文表现有实质影响。适配器秩增大带来的是“温和提升”,其收益与训练成本的权衡仍待更细的刻画。

来源