跨25个模型定位VQ视觉语言模型的L0注意力路由回路,仅消融该回路使开放生成物体幻觉相对下降31%
核心概要
该研究用激活修补在横跨八个LLM家族的二十五个模型上识别出VQ分词视觉语言模型共有的早期层(L0)注意力路由回路,提出三门槛诊断区分出十个携带该回路的模型并排除其余十五个,通过单变量架构替换(LLaVA-1.6 CLIP+MLP→VQ+Linear)证明向量量化是该病理性信号的来源,并显示只有L0消融能在开放生成中降低物体幻觉(CHAIR_i相对下降31%),而调优后的DoLA与VCD无此效果。
Figure 1: Methodology overview. Clean and corrupted image pairs are constructed and passed through the transformer; residual divergence and early-layer attention mass are measured to detect a routing circuit via a three-gate diagnostic. Models passing all three gates have a VQ-installed L 0 L_{0} circuit confirmed by a single-variable causal control: swapping only the projector type from MLP to VQ installs the circuit; a matched-compute MLP control does not. Ablating L 0 L_{0} reduces object hallucination in open-ended generation (CHAIR i drops 31% relative) while tuned DoLA achieves better binary calibration.
arXiv深度剖析
研究识别出一个跨架构共享的早期层(L0)注意力路由回路,存在于VQ分词的统一视觉语言模型中,并据此提出三门槛诊断,将十个模型判为阳性(三个LLM家族中的五个自然统一VQ模型加五个诱导变体),拒绝其余十五个。 此前对物体幻觉的解码期修正把它当作通用校准问题,缺少架构层面的解释;该工作把幻觉与具体的架构与预训练属性联系起来,并给出可区分携带者与非携带者的诊断。 基于二十五个模型、八个LLM家族的激活修补,阳性与阴性分组明确(十对十五)。
单变量架构替换(LLaVA-1.6 CLIP+MLP→VQ+Linear)会安装该回路,而在相同数据上等算力的MLP对照不会,从而把向量量化隔离为病理性信号的来源;承载该信号的路径是骨干网络本就提供的。 这是对因果来源的受控隔离,而非仅相关性观察,把向量量化而非一般视觉编码器差异指认为关键变量。 单变量替换与等算力MLP对照在相同数据上形成对照设计。
在开放生成中,只有L0消融降低物体幻觉,CHAIR_i相对下降31%,而调优后的DoLA与VCD使其不变或更差;在二元校准上,调优后的DoLA优于基线。 说明机制无关的解码方法无法复现这一针对性干预,且校准改善与开放生成幻觉降低是两件不同的事。 与调优VCD和DoLA基线对比,报告了CHAIR_i相对下降31%的效应量。
启示与展望
该结果面向采用向量量化码本对图像分词的统一视觉语言模型,适用于接地是/否基准与开放生成评测场景;对这类模型,L0消融是可落地的干预点,三门槛诊断可用于判断某模型是否携带该回路。对使用其他视觉分词方式或非统一架构的模型,本文未给出适用性结论。
读者仍会关心:三门槛诊断在本文二十五个模型之外的新模型上是否稳定;L0消融在开放生成之外的任务上是否保持收益;以及向量量化与预训练各自贡献的相对比例。本文以摘要形式呈现,未展开具体数据集、提示设置与统计细节,这些是进一步判断时需要核对的开放问题。
