arXiv 2026年10月5日该工作提出免训练的 Patch-to-Prune(P2P)框架,把机制可解释性中的激活修补从诊断工具改造为推理期计算旁路:通过验证引导的前向与后向层扫描,找出视觉 token 投影输出可被固定中性代理激活向量替换的解码器区域,在用户指定的精度容差内跳过这部分计算;在 Qwen2.5-VL 与 LLaVA 两族共四个 VLM、七个多模态基准上,使用互不相交的校准、验证与测试划分评估,3% 容差下保留约 94% 稠密精度并将 FLOPs 降低 55%,同时层间分析提示 VLM 的视觉处理在解码器深度上分布不均。该工作提出免训练的 Patch-to-Prune(P2P)框架,把机制可解释性中的激活修补从诊断工具改造为推理期计算旁路:通过验证引导的前向与后向层扫描,找出视觉 token 投影输出可被固定中性代理激活向量替换的解码器区域,在用户指定的精度容差内跳过这部分计算;在 Qwen2.5-VL 与 LLaVA 两族共四个 VLM、七个多模态基准上,使用互不相交的校准、验证与测试划分评估,3% 容差下保留约 94% 稠密精度并将 FLOPs 降低 55%,同时层间分析提示 VLM 的视觉处理在解码器深度上分布不均。P2P 将激活修补转为推理期计算旁路,在 3% 容差下保留约 94% 稠密精度并把 FLOPs 降低 55%该工作提出免训练的 Patch-to-Prune(P2P)框架,把机制可解释性中的激活修补从诊断工具改造为推理期计算旁路:通过验证引导的前向与后向层扫描,找出视觉 token 投影输出可被固定中性代理激活向量替换的解码器区域,在用户指定的精度容差内跳过这部分计算;在 Qwen2.5-VL 与 LLaVA 两族共四个 VLM、七个多模态基准上,使用互不相交的校准、验证与测试划分评估,3% 容差下保留约 94% 稠密精度并将 FLOPs 降低 55%,同时层间分析提示 VLM 的视觉处理在解码器深度上分布不均。该工作提出免训练的 Patch-to-Prune(P2P)框架,把机制可解释性中的激活修补从诊断工具改造为推理期计算旁路:通过验证引导的前向与后向层扫描,找出视觉 token 投影输出可被固定中性代理激活向量替换的解码器区域,在用户指定的精度容差内跳过这部分计算;在 Qwen2.5-VL 与 LLaVA 两族共四个 VLM、七个多模态基准上,使用互不相交的校准、验证与测试划分评估,3% 容差下保留约 94% 稠密精度并将 FLOPs 降低 55%,同时层间分析提示 VLM 的视觉处理在解码器深度上分布不均。