跳到主要内容
返回时间线
arXiv来源发表:

AnswerMap 用行、列条带的“yes”后验外积生成 VLM 空间解释图,在四个模型上删除其区域可翻转 53% 的正确答案

核心概要

该工作提出 AnswerMap:把图像切成 K 个行条带与 K 个列条带,分别单独送入冻结的视觉语言模型并问一个关于查询的是/否问题,取行、列“yes”后验的外积得到查询条件下的空间图,再在图上定义固定读出(如期望、最大值)直接导出连续输出;在四个模型、三种查询分布上,该图与模型自身生成点的 AUC 为 0.85(注意力为 0.38),删除其区域使 53% 的正确答案翻转(注意力为 19%),并可用最大值标记幻觉对象、用期望在模型自身指向失败时定位、用最高质量区域裁剪修正约一半错误答案。

AI-generated editorial illustration: AnswerMap: Faithful Spatial Interpretability of VLMs from Answer Posteriors

深度剖析

提出 AnswerMap,一种免训练、任务无关、黑盒的空间解释:图像被切成行与列条带,每条带单独与查询一起以是/否相关问题呈现给冻结模型,行与列“yes”后验的外积构成查询条件下的空间图。 与依赖文本理由(模态不匹配、无法对照图像检验)或内部读出(产生于答案生成之前、需要白盒访问)的既有工具不同,该方法的每个单元分数是对该区域单独作出的完整对比识别判断,而非从完整图像中移除该单元的边际效应。 论文给出方法定义与成本说明:K×K 图只需 2K 次前向,而同一网格下遮挡需要 65 次;仅需两个标签的首 token logprobs,因此可在闭源模型 API 上运行(论文报告在 GPT-6-sol 上运行)。

用两个无需真值的测试验证忠实性:图应与模型自身生成的点一致,删除图的区域应破坏正确答案。 论文把这两个测试作为适用于任何 VLM 空间解释的协议提出,并在四个模型(Qwen3-VL-4B/8B/30B-A3B、InternVL3.5-8B)与三种查询分布(RefCOCOg、RefCOCO+、CAVE)上报告结果。 一致性与模型自身点比较:AUC 0.85 对注意力 0.38;删除测试中翻转 53% 的正确答案,注意力为 19%,均匀随机区域为 8.2%;空白图像对照使两项指标恰好落在随机水平,换图对照显示图跟随所给图像。

同一张图配不同固定读出可承担不同下游任务:最大值可在不生成的情况下标记幻觉对象,期望可在模型自身指向失败时正确定位,最高质量区域作为裁剪反馈可修正模型约一半错误答案。 这把解释图同时当作输出接口:对连续输出任务(如位置)不再依赖离散文本 token,且按构造保证答案依赖图像。 POPE 上模型给出 4,006 次“yes”,其中 223 次为幻觉,图最大值以 ROC-AUC 0.833 区分两类主张;在指向较弱的 Lingshu-7B 上,期望比模型自身生成点高 11 个百分点;TextVQA 上图的裁剪把 42 个错误答案中的 50% 改正,随机裁剪为 38%。

多网格乘积与消融给出使用建议:组合互质网格在五倍查询预算范围内保持稳定,乘积融合优于均值与最大值。 论文把单网格细化与互质网格组合作为两种查询预算花费方式对比,并指出嵌套网格会重复计算相关证据。 消融在 Qwen3-VL-4B 与 RefCOCOg 上进行:细化单网格在 12 次查询处达到窄峰后随条带变薄而崩塌,互质组合在 16 次查询处达到同一峰值并保持平坦;融合规则上乘积 1.50 优于均值 1.39 与最大值 0.89。

启示与展望

该结果面向需要核查 VLM 空间依据的读者,例如阅读生成报告的放射科医生或核查主张的审计者,也面向希望在不获取模型权重的情况下审计模型的开发者。方法适用于接受非方形输入的模型(原生或通过分块),因为每条带是细长条;论文报告其在四个开源权重模型与一个闭源 API 模型上无需逐模型调参即可运行。三个读出分别对应不同场景:最大值用于对象存在性主张的幻觉审计,期望用于模型自身指向失败时的定位,最高质量区域裁剪用于在回答前向模型提供近景。论文还提出把图作为无标签监督训练接口、以及探测引导生成等后续步骤。

论文自述两点范围限制:算子需要接受非方形输入的模型;由于图由行与列答案构成,它知道哪些行与哪些列包含查询,但不知道是哪一对行列,因此当查询匹配两个分离对象时,图也会点亮它们行列交叉处的两个空单元。此外,读出被作者称为主要设计面,更丰富的读出(范围、计数、关系)尚未展开;论文报告最大值读取的是空间承诺而非答案对图像的依赖(对整图标签的 AUC 为 0.49),因此不同读出回答的是不同问题。本总结依据的是论文全文与摘要,未包含论文未报告的数据或未列出的实验。

来源