跳到主要内容
返回时间线
arXiv来源发表:

SCOPD 用稀疏上下文在线自蒸馏把 10% 视觉 token 下的 VLM 性能从 86.37% 提升到 92.43%

核心概要

该工作通过固定上下文的 Pass@K 分析发现视觉 token 剪枝后的性能下降并非全是信息丢失,而是模型未能可靠利用残留证据(表征—利用差距),并提出 SCOPD 与 SCOPD+ 两种稀疏上下文在线自蒸馏方法,在 10% 视觉 token 保留率下把 13 个基准的归一化平均性能从 Vanilla 的 86.37% 提升到 90.49% 和 92.43%,且不改变架构、不增加推理开销、不需要真实答案。

AI-generated editorial illustration: SCOPD: Sparse-Context On-Policy Self-Distillation for Efficient Vision-Language Models

深度剖析

论文提出并验证了“表征—利用差距”:在 500 个图像—问题对上,视觉表征只剪枝一次并固定不变,贪心解码成功率大幅下降,但同一稀疏表征下重复采样可恢复大量原本失败的样例,而纯语言(去掉图像)对照几乎为零。 此前普遍把激进剪枝后的性能下降归因于任务相关视觉信息的不可逆丢失;该分析表明证据可能仍然可访问,只是模型在推理中未能稳定使用。 固定上下文 Pass@64 诊断,500 个自由数值问答对(来自 MMStar、CVBench、MMMU-Pro、BLINK、LogicVista、LLaVA-CoT),VisionZip 保留 10% token,并用 GPT-6-Astra-Max 作为推理有效性判定,语言-only 对照接近零。

SCOPD 让稀疏上下文学生生成推理轨迹,由拥有完整视觉上下文的特权教师在同一在线前缀上做 token 级监督,无需真实答案、推理轨迹或架构改动。 把在线自蒸馏从语言模型或模型结构剪枝场景,迁移到“条件表征被刻意稀疏化”的场景,用对应的未剪枝表征作为特权监督。 13 个图像基准上,10% 保留率时归一化平均从 Vanilla 的 86.37% 提升到 90.49%,20% 保留率时从 93.42% 提升到 96.80%,优于 SFT、GRPO 和 EPIC 基线。

SCOPD+ 用小幅视觉预算干预识别对视觉证据敏感的响应位置,只对这些位置做蒸馏并只对部分响应位置反传。 不依赖教师—学生 KL 分歧本身,而是直接扰动学生可用的视觉证据并保持推理前缀固定,从而把视觉相关的分歧与普通语言层面差异区分开。 10% 保留率下 Avg13 达 92.43%,在 13 个基准中 8 个优于 SCOPD、2 个持平;消融中 SCOPD+ 的 Avg6 为 95.25,高于密集 SCOPD 的 94.44、Top-KL 的 94.51、TIP 的 94.21、随机选择的 93.56,而选择最不敏感位置降至 89.13。

稀疏上下文适应可跨剪枝算子、模型家族和图像到视频迁移,且不增加推理成本。 训练只用 VisionZip,但评估时无需再适应即可在 DivPrune、随机剪枝、FastV 上提升;Qwen3-VL-4B 与五个视频基准同样受益。 跨算子 Avg6 均提升(VisionZip 88.74→95.25、DivPrune 83.47→91.23、随机 82.06→88.85、FastV 81.47→86.03);Qwen3-VL-4B 上 75.29→81.60/82.92;视频 Avg5 从 90.88 提升到 95.70/96.60;SCOPD+ 训练理论算力增加 21.4% 但实测时间仅增加 1.9%,推理时无额外计算。

启示与展望

该结果面向在部署时使用免训练视觉 token 剪枝的推理型 VLM:当任务相关证据仍留在稀疏表征中时,SCOPD 与 SCOPD+ 通过在线自蒸馏让语言模型更可靠地使用这些证据,适用于固定保留预算下的图像与短视频推理。训练侧只需图像—问题对,不需要真实答案或推理轨迹,视觉编码器与多模态投影器保持冻结,仅用 LoRA 适配语言模型;因此它适合作为现有剪枝流程之上的后训练步骤,而不是替代剪枝算子本身。

固定上下文 Pass@ 诊断是受控诊断集(500 个自由数值问答对)而非官方基准评测,其结论在多大范围上成立仍待更广任务验证;训练以 VisionZip 与固定保留预算为主,更广泛的 LLM 内部剪枝、动态剪枝与联合学习压缩策略尚未覆盖;评估集中在短程图像与视频推理,长时程视频、具身与智能体任务中视觉证据的保持与利用是否同样受益仍是开放问题;此外,SCOPD+ 的收益依赖视觉敏感性选择比例与干预预算两个超参数,其最优取值是否随模型与任务变化需要进一步观察。

来源