跳到主要内容
返回时间线
arXiv来源发表:

MIST压力测试:给VLM评审员加一张图,约两成标签改变,且与图的内容无关

核心概要

研究者构建了MIST(误导性图像压力测试),包含200个英文句子,每句含一个可作字面或比喻解读的短语,并分别配以与句意一致的图像、与句意相反的图像或不配图像;在13个视觉语言模型评审员上,配一致图像改变20.5%的标签、配误导图像改变19.4%,而仅删除“忽略图像”指令、图像保留只改变11.6%,且两张图像之间出现分歧的标签中只有37%朝图像所示含义移动,与人类标注者的一致率在无图、一致图、误导图三种情况下基本不变。

AI-generated editorial illustration: It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them

深度剖析

MIST把“图像是否被使用”与“图像内容是否影响判断”分开:一致图像与误导图像造成的标签改变率几乎相同(13个评审员上为20.5%对19.4%,正文报告的7个评审员为15.9%对14.7%,任一评审员两者相差不超过5个百分点)。 此前的多模态基准(如IRFL、AdMIRe)把图像本身当作判断对象,改变图像就合法地改变答案;MIST则要求标签只由句子决定,图像按构造是保标签的扰动,因此任何标签变化都是错误。 200个英文条目、来自200个不同复合词,四种条件各50条;13个评审员、四种提示、显式与静默两种图像指令,共52,000个标签,贪心解码并约束为四个标签之一。

图像带来的变化并不朝图像所示含义移动:在两张图像产生分歧的17.1%(1,776/10,400)单元格中,只有37%朝误导图像所示含义移动,63%反向移动;通过alt-test的7个评审员全部低于50%的随机水平,最高为39%。 这否定了“图像会把评审员拉向它所描绘的解读”这一预期,把效应定位为“有图”而非“图是什么”。 按句子类型分别统计同样成立(比喻句683个单元格中38%跟随图像,字面句1,093个中35%);71%的移动仍停留在比喻—字面分界线的同一侧。

图像并未降低与人类多数标签的一致率:无图54.4%、一致图53.7%、误导图54.7%,13个评审员中只有5个在配图后准确率下降。 说明聚合层面的一致率看不见实例级的不稳定——每个变化按构造都是错误,但在总量上相互抵消,因此基于总体一致率的可替代性判定无法察觉这一现象。 一致率按与看到该条目的三人小组的人类多数标签精确匹配计算;误导条目上一致率更低,但无图时这一差距最大,指向两组不重叠表达集的难度差异。

不稳定性出现在从业者会部署的模型上:通过alt-test的7个评审员配图后改变15.9%的标签,从未通过的6个为25.8%,但每一组在配图下的变化都超过仅删除“忽略图像”指令的对照(7个评审员为8.8%,13个为11.6%)。 把可替代性判定重新表述为对“模型加配置”的描述,而非仅对模型的描述,并建议部署报告写明所用提示与所附的无关上下文。 对照条件保持图像不变、只删除要求忽略图像的段落,为提示编辑本身能移动多少标签给出上界;每个评审员单独看都超过该上界。

启示与展望

这项工作面向使用VLM评审员替代人类标注者的评测与数据生产流程:它给出MIST这一不变性测试及全部人类与VLM标签,使实践者可以在自己的提示与上下文配置下检查判定是否稳健,并据此在部署报告中写明所用提示与所附的无关上下文。结果适用于英文、可能习语表达这一任务设定,评审员关闭推理模式。

两张图像都与目标短语相关,因此对比的是两张相关图像,而非相关图像与完全无关图像;标签虽按FF到LL排序,但FF与WF、FL与LL两个边界是不同性质的判断,一步移动在各处并不等价;由于每位人类标注者每个表达只看到一个条件,没有人类自身的标签变化率,提示编辑对照只提供评审员内部的基线;人类在一致图与误导图之间的一致率差异未被分辨,作者据此把该对比报告为未解决;句子真正改变解读时评审员是否也随之移动,是MIST未做的互补测量;效应是否特定于alt-test与比喻语言标注,是下一步的问题。

来源