跳到主要内容
返回时间线
arXiv来源发表:

多模态大模型能编码图表信息却无法将其传递到预测位置,研究用逐层线性探针与注意力分析解释了表格-图表验证差距

相关研究与后续进展

核心概要

该研究针对多模态大模型在科学论断验证中表格证据表现明显优于同源数据图表证据的现象,用逐层线性探针与注意力分析考察三个开放权重视觉语言模型,发现图表信息确实被编码进中间表示但未能到达预测位置,而表格不存在这一断连,且该断连在不同模型家族中呈现两种架构上不同的形式,从而把表格-图表差距重新界定为预测阶段对已编码视觉信息的使用失败而非编码失败。

Source-provided article image: Encoded but Not Routed: Explaining the Table-Chart Gap in Scientific Claim Verification
Figure 1 ·

Figure 1: Overview of our approach. We apply linear probing to compare how chart and table evidence is encoded and passes to the model response.

arXiv

深度剖析

研究回答了模型在图表证据上表现较差是源于提取失败还是使用失败这一问题,结论支持后者:图表信息被编码在模型的中间表示中,但没有到达预测位置。 此前工作只观察到表格证据上的验证表现明显优于同源数据的图表证据,本研究把这一表现差距推进到机制层面,区分了编码环节与预测环节。 证据来自对三个开放权重视觉语言模型的逐层线性探针与注意力分析,表格与图表承载相同底层数据,且该结论在所有测试条件下保持一致。

表格不存在这种编码与预测之间的断连,说明该现象与证据的呈现形式相关,而非模型普遍无法利用中间表示。 通过在同一底层数据上对比表格与图表两种呈现,把差距定位到呈现形式而非数据内容本身。 对比在同一底层数据、同一任务下进行,断连在表格条件下缺失,在图表条件下稳定出现。

注意力分析显示这种断连在不同模型家族中表现为两种架构上不同的形式。 把单一的表现差距细化为跨模型家族可区分的机制类型,提示该问题不是某一实现的特例。 结论基于对三个开放权重视觉语言模型的注意力分析,并在所测试的模型家族间呈现形式差异。

启示与展望

该结果适用于以表格或图表作为证据、需要判断论断是否被证据支持的科学论断验证场景,尤其是多模态大模型辅助同行评审的用途。它面向研究多模态模型证据使用机制的研究者,以及设计需要模型读取图表证据的验证流程的工程实践者。在此设定下,结论提示改进方向可以放在预测阶段如何调用已编码的视觉信息,而不必只着眼于让模型更好地提取图表内容。

读者仍可关注:两种架构上不同的断连形式分别对应哪些模型家族,以及这一区分在更多模型上的稳定性;断连在何种条件下会减弱或消失;以及从预测阶段改善视觉信息调用后,验证表现能恢复到什么程度。所加载文本为摘要层面的内容,未包含具体探针设置、注意力指标与逐模型结果,因此上述细节有待查阅原文图表与实验部分确认。

来源