P2P 将激活修补转为推理期计算旁路,在 3% 容差下保留约 94% 稠密精度并把 FLOPs 降低 55%
相关研究与后续进展核心概要
该工作提出免训练的 Patch-to-Prune(P2P)框架,把机制可解释性中的激活修补从诊断工具改造为推理期计算旁路:通过验证引导的前向与后向层扫描,找出视觉 token 投影输出可被固定中性代理激活向量替换的解码器区域,在用户指定的精度容差内跳过这部分计算;在 Qwen2.5-VL 与 LLaVA 两族共四个 VLM、七个多模态基准上,使用互不相交的校准、验证与测试划分评估,3% 容差下保留约 94% 稠密精度并将 FLOPs 降低 55%,同时层间分析提示 VLM 的视觉处理在解码器深度上分布不均。
Figure 1: Framework of Patch-to-Prune
arXiv深度剖析
提出 P2P:一个免训练框架,把激活修补从诊断手段转为推理期计算旁路,用固定中性代理激活向量替换部分解码器区域中视觉 token 的投影输出。 与常规 token 剪枝不同,P2P 保留序列长度、token 顺序、位置信息、注意力掩码与残差通路,因此是在不删除 token、不修改预训练权重的前提下剪掉计算。 方法描述明确给出前向与后向层扫描、验证引导以及用户指定精度容差等机制;评估覆盖 Qwen2.5-VL 与 LLaVA 两族共四个 VLM、七个多模态基准,并使用互不相交的校准、验证与测试划分。
在 3% 容差设置下,P2P 保留约 94% 的稠密精度,同时将 FLOPs 降低 55%。 该结果把精度损失与计算节省放在同一容差参数下报告,使效率与保真度之间的取舍可被显式调节,而非依赖固定剪枝比例。 数字来自摘要所述的多模型、多基准评估;具体每个模型与基准的分解数值未在加载文本中给出。
层间分析提示 VLM 的视觉处理在解码器深度上非均匀分布:早层与晚层往往只需很少的 token 特异性视觉计算,中间层似乎承担大部分任务相关的视觉整合。 这一观察把效率框架同时用作因果视角,说明后续推理可以较大程度依赖已嵌入共享残差与文本表示的视觉信息。 该结论以“suggests / appear to”表述,属于基于层扫描的因果性提示,而非已确立的机制定论。
启示与展望
该框架面向希望在不重训练、不改动预训练权重的前提下降低 VLM 推理算力的工程与研究场景,通过用户指定的精度容差来调节计算旁路的范围。其适用对象是加载文本中评估的 Qwen2.5-VL 与 LLaVA 两族共四个 VLM 及七个多模态基准;层间非均匀分布的观察为后续研究提供了可检验假设,即中间层承担主要视觉整合、早层与晚层的 token 特异性视觉计算需求较低。
加载文本为摘要级内容,未包含图表与逐基准结果,因此无法判断 94% 精度保留在不同模型、不同任务类型上的波动范围,也无法确认 3% 容差是否为最优工作点。层间非均匀分布以“suggests / appear to”表述,属于因果性提示而非定论,其在不同 VLM 架构与视觉任务上的稳定性仍是开放问题。此外,中性代理激活向量的构造方式与验证引导扫描的搜索成本未在加载文本中说明。
