跳到主要内容
返回时间线
arXiv来源发表:

用OCR头把图像语义“说出来”:视觉语言模型中的泛化言语化头与言语化透镜

核心概要

该研究在四个视觉语言模型(Qwen3-VL-2B、Qwen3-VL-8B、Molmo2-7B、Llava-Next-34B)中定位出对OCR因果必要的注意力头,发现它们其实是通用的“言语化头”,把这些头的输出-值(OV)矩阵求和构成一个“言语化透镜”后,可在任意层(包括第0层)把图像token的隐藏状态解码为可解释的语义词,并可用其伪逆构造概念向量来编辑图像表征(如把“拖拉机”替换为“左轮手枪”),从而为“图像表征在早期层就与语言空间对齐”提供了证据。

Source-provided article image: Using OCR Heads to Verbalize Image Semantics
Figure 1 ·

Figure 1 : We find that VLM attention heads responsible for OCR are actually generic verbalization heads that can read out semantics of image tokens that do not contain text. (a) Verbalization heads attend to text when prompted to transcribe words, but manually redirecting their attention to image tokens that do not contain text causes the model to output words corresponding to the semantics of those tokens (top 10% of Qwen3-VL-8B verbalization heads). (b) We repurpose these heads’ attention weights to create a verbalization lens that can be applied to image representations from any layer. Here, our approach reveals alignment of image representations with language space starting from layer 0, which logit lens is unable to see.

arXiv

深度剖析

识别出对OCR因果必要的注意力头,并证明它们并非OCR专用,而是能对非文字图像token输出语义词的通用言语化头。 此前对VLM中OCR机制的研究多停留在注意力可视化或行为层面,这里用logit lens给每个头打分(式1),再以均值消融验证因果性:消融得分最高的前10%头会“完全破坏”OCR任务表现,而消融同等数量的随机后层头效果更弱;同时把注意力强制指向鸟翼、树枝等非文字token时,Qwen3-VL-8B会输出“_feathers”“_branch”。 四个模型、三个模型家族上一致;OCR数据集n=1024用于打分,消融在100张图像、10个随机种子上进行;模型在ImageNet背景上的OCR准确率为0.80–0.93(白底仅0.05–0.75,故采用真实背景)。

把言语化头的OV矩阵求和为单一线性变换(式3),与词表投影结合构成“言语化透镜”(式4),可在所有层、包括第0层读出图像token的语义标签。 原始logit lens在早中期层噪声很大,而该透镜在第0层即可给出可解释结果,说明图像表征从进入语言解码器起就已与语言空间对齐;在COCO单token类别(Qwen3模型56/80类)上,含目标图像与不含目标图像的P(o)差距比原始logit lens更大,且跨层稳定,ROC-AUC接近上限。 COCO验证集上每类采样n=512张含目标与n=512张不含目标图像(Llava-Next-34B为n=128);与原始logit lens、等量随机头对比;并用与LatentLens相同的LLM评判指标,在Llava-Next-34B上平均提升40.5分,其余模型持平。

言语化透镜读出的子空间具有因果作用:用其伪逆(式5–7)得到概念隐向量,可在所有层和图像token位置做加/减编辑(式8–9),替换图像中的物体概念。 这超越了“只做可解释性读出”的层面,给出该子空间对模型图像描述具有因果影响的证据;例如把“蚂蚁”替换为“iPod”后,模型仍保留原物体的颜色与质感(描述为“有光泽的红棕色经典款”),把“拖拉机”替换为“左轮手枪”后模型把车轮、车牌、驾驶员综合成“超现实的、被创意改装成经典汽车的左轮手枪”。 在n=256张随机ImageNet图像上用LLM评判(o4-mini)按概念出现度、特异性、连贯性打分;编辑需α>1才有效,α=10会损害特异性;采用解释L_p能量前ρ=60%的秩,秩与α在100张图像上先行扫描。

言语化头与已有头类型存在部分重叠,提示OCR这一窄任务可作为识别更一般“像素到语义”机制的入口。 在Qwen3-1.7B的11个filter heads中有6个落入言语化头前10%;Qwen3-VL-2B中30%(3/10)、Qwen3-VL-8B中29%(29/100)的gaze heads同时是言语化头,高于随机抽样期望,说明二者相关但并非同一批头。 基于已有工作公开的头集合做重叠统计,并给出随机重叠的期望值作为对照;属于相关性证据,作者也将其表述为“可能存在关系”。

启示与展望

该结果适用于所研究的四个视觉语言模型(Qwen3-VL-2B、Qwen3-VL-8B、Molmo2-7B、Llava-Next-34B)及其图像token表征;言语化透镜面向需要把隐藏状态快速解码为语义标签的场景,编辑实验聚焦单token概念,并在Qwen3-VL模型上验证。对希望复用该方法的读者,公开的代码与交互演示可直接用于跨模型读出;对关注多token概念、更大概念集合或像素级定位的读者,本文的设定提供了起点而非终点。

读者仍可关注:言语化透镜在token级定位上的mIoU与mAP整体偏低(如Qwen3-VL-8B为0.190/0.407),作者将其部分归因于register token行为,这一解释在多大范围成立仍是开放问题;编辑效果依赖秩与缩放因子α的扫描,α过大(如10)会损害特异性,不同模型所需α不同;概念编辑目前限于单token概念,多token或更抽象概念的编辑效果尚待观察;言语化头与filter heads、gaze heads的重叠是相关性证据,其确切功能边界仍有待进一步刻画。

来源