SAGE 通过抑制提示无关视觉注意力汇,在多个 VLM 家族上提升视觉定位并降低幻觉
核心概要
该工作重新审视视觉语言模型解码器中的视觉注意力汇,发现早期与末层解码器在不同提示下反复把注意力集中到同一批图像区域(称为提示无关汇 PIS),而中间层才随查询变化并承担视觉-语言对齐;据此提出免训练的 SAGE,用来自 CLIP、ViT、DINOv3 等标准视觉骨干的 token 对齐 ROI 掩码对视觉 token 注意力 logits 施加加性偏置,把注意力从 PIS 引向查询相关区域,在 LLaVA-1.5、Qwen2-VL、InternVL3、NVILA 等模型上改善视觉定位、降低幻觉并在多项公开基准上取得增益。
Figure 1: Prompt-Invariant Sinks and prompt-conditioned mid-layer attention in a VLM decoder. We visualize decoder attention over visual tokens for three different prompts (rows) at representative early, mid, and final decoder layers (columns). Early and final layers exhibit prompt-invariant attention collapse onto nearly identical image regions across prompts, forming Prompt-Invariant Sinks. In contrast, mid-layer attention is prompt-conditioned: it shifts to the menu board when asking for the espresso price (Prompt 1), to the wall clock when asking for the current time (Prompt 2), and becomes broader for holistic scene description (Prompt 3). Warmer colors indicate higher attention.
arXiv深度剖析
论文识别出提示无关汇(PIS):在三个差异明显的提示下,早期与最终解码器层反复对几乎相同的图像位置赋予高注意力,即使问题改变;而中间层是唯一持续随提示响应的部分,例如查询“espresso price”时注意力移向菜单板、查询时间时移向时钟。 此前工作已确立视觉注意力汇的存在,但多把汇视为跨层聚合后的统一现象;本文按层分析,指出汇行为在深度上是有结构的,而非均匀的。 证据来自逐层注意力可视化(图 1)以及两项独立诊断:提示无关汇集合的跨提示 IoU 与 top-1 谱集中度,二者在 LLaVA-1.5 与 Qwen2-VL 的 TextVQA、GQA 上强相关。
论文提出 SAGE:一种免训练、推理时的干预,对选定解码器层的视觉 token 注意力 logits 施加加性偏置,放大 ROI 内 token 并抑制非 ROI token,从而在保持原模型参数不变的情况下重新分配注意力预算。 ROI 掩码可由多种标准视觉骨干生成并映射为 token 对齐掩码;CLIP 依赖查询,ViT 与 DINOv3 仅提供与查询无关的显著性,三者都能驱动同一干预规则。 方法为推理时 logit 偏置,无需梯度更新;在 LLaVA-1.5、Qwen2-VL、InternVL3、NVILA 上以固定偏置强度实例化,并配合单层扫描与多层组合实验。
在多项公开基准上,SAGE 相对无干预基线取得增益,尤其在强调细粒度成对视觉判别的 MMVP 系列上提升明显,例如 LLaVA 1.5-13B 的 MMVP Pair 从 11.85 提升至 37.78(CLIP ROI)。 增益出现在选定的解码器深度上,且有效深度随模型家族与基准变化;多层组合中,中段与末段组合(如 Mid–final 62.60、Final–final 62.42)强于极早层组合(Very-early only 19.19)。 表 1 报告每个模型、基准与 ROI 来源下的最佳单层结果,属于层扫描下的峰值效应上界;表 2 按归一化深度分组给出 TextVQA 平均准确率。
固定层与 ROI 内容对照表明增益依赖目标区域内容:在 LLaVA-1.5-7B 上,用无标签诊断预先选定单一固定层后,TextVQA 从 44.0 升至 54.6、GQA 从 57.1 升至 62.3,而把 ROI 替换为同尺寸随机 token 集合后所有基准回到基线或以下。 该对照把“注意力扰动本身”与“引导到正确区域”区分开,说明效果并非任意扰动注意力分布的副产品。 固定层设置不按基准选择层,随机 ROI 对照保持干预层、偏置强度与掩码大小不变,仅替换掩码内容。
启示与展望
该工作面向视觉编码器加纯解码器 LLM 的 VLM,在推理阶段以 token 对齐 ROI 掩码引导注意力,适用于决定性证据集中在单一局部区域的问题,例如读取远处标牌文字或核对机身编号。对希望在不重训模型的前提下改善定位与细粒度判别的工程读者,SAGE 提供了可直接复用的接口:掩码可由 CLIP、ViT 或 DINOv3 生成,干预层可单层或多层指定,偏置强度全局固定。论文也给出跨四个模型家族的固定协议结果,说明该干预不局限于单一架构。
SAGE 的效果取决于 ROI 估计质量:碎片化或错位的掩码会把注意力引向无关 token 并压制真实证据,而随机 ROI 对照显示无信息掩码会完全消除增益,因此部署时可能需要一个置信信号来决定是否干预。干预对所有解码步与所有注意力头广播同一掩码,更适合单一决定性区域的问题,对多区域描述或多步推理的适用性仍待检验。诊断停留在深度层面而非单个 token 层面,显式抑制汇 token 是否能叠加增益尚未测试,同一归一化深度能否跨模型家族迁移也需重新运行诊断。论文未解释为何早层与末层形成提示无关汇而中间层保持提示响应,这一形成机制仍是开放问题。
