跳到主要内容
返回时间线
arXiv来源发表:

多模态大模型的幻觉源自“协同头”内部信息分布漂移

核心概要

该工作提出 HEAL,通过对多头注意力输出施加因果噪声干预并用反事实双重差分把注意力头分为冗余、视觉、语言与协同四类,发现幻觉发生在协同头内部视觉—语言信息分布偏离健康均衡之时,而非与模态专属头的数量或强度强相关,并据此在推理时向协同头的 value 向量注入动态校准因子,在多个 MLLM 与多个基准上降低了幻觉。

AI-generated editorial illustration: MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads

深度剖析

提出 HEAL,用因果噪声干预与反事实双重差分把注意力头划分为冗余、视觉、语言、协同四类,给出头级别的可解释视角。 既有基于注意力的方法多依赖注意力权重等间接信号,HEAL 直接干预头输出并测量层表示变化,从而在头级别拆解信息构成。 论文在 LLaVA、Qwen、InternVL 等多个模型族上给出分类结果,并报告在零掩码、均匀掩码、替换真实 token 等不同掩码策略下头分类一致率为 92.13%–95.36%。

识别出协同头内部的视觉—语言信息失衡是影响幻觉的可因果干预因素,并刻画注意力头的“任务驱动相变”。 不再把幻觉单纯归因于宏观层面的模态头数量或强度,而是定位到协同头内部信息分布的漂移。 双向因果分析显示,人为降低视觉信息比例可诱发幻觉,提高视觉信息比例可缓解幻觉;在多种掩码策略与阈值设定下,正确 token 与幻觉 token 在协同头中的视觉—语言比例差异持续可观察。

提出带理论支撑的动态校准策略,用均衡因子调节视觉—语言信息分布,把表示几何可预测地推向均衡方向。 与只强化某一模态的注意力增强方法不同,HEAL 在视觉与语言之间做均衡再分配,并给出 value 空间校准等价于信息分布校准、均衡因子对视觉对齐具有单调方向效应的两条定理。 在 POPE、CHAIR、MME、LLaVA-Bench、MMHal-Bench、BLINK-Twice 等基准上,作为即插即用模块在 LLaVA-1.5-7B、LLaVA-NeXT-7B、Qwen2-VL-7B、Qwen2.5-VL-7B、InternVL-7B、Qwen3-VL-8B、InternVL3.5-8B 上报告了一致的幻觉指标与综合指标改善。

启示与展望

该结果面向推理阶段的注意力头校准,适用于视觉与语言信息都已存在于模型内部、但解码时分布失衡的情形;论文报告其在 LLaVA、Qwen、InternVL 等模型族以及 POPE、CHAIR、MME、LLaVA-Bench、MMHal-Bench、BLINK-Twice 等基准上的表现,并指出均衡因子在 0.4–0.6、更新间隔在 5–15 步时表现稳定,可作为实践中的选择区间。

均衡因子与更新间隔目前由经验确定,论文也说明尚无闭式理论规则,且不同模型与任务的最优取值存在差异;由早期视觉编码失败或输入本身缺乏视觉证据导致的幻觉,注意力头校准难以解决;论文指出当前基准尚未显式隔离“视觉描述与语言推理快速切换”这一现象,其影响难以直接量化;此外,本次载入的是全文文本,若图表细节未完整呈现,涉及具体图示的结论仍需对照原文图表确认。

来源