跳到主要内容
返回时间线
arXiv来源发表:

大模型没有专用感知编码器也能“看见”:Ogata与Nakashima发现多模态Transformer在早中层自发形成“虚拟编码器”

核心概要

Ogata与Nakashima研究当多模态语言模型不依赖专用感知编码器、而是直接把轻投影的图像块、音频帧或离散视觉token交给共享Transformer时,编码发生在何处,并通过线性探测、与感知编码器的相似性比较以及因果分析,发现Transformer会在自身早到中层内部化这一缺失的计算,构建出任务可用的感知表示,作者称之为“虚拟编码器”。

Source-provided article image: Virtual Encoders in Multimodal Transformers
Figure 1 ·

Figure 1 : Three MLLM families distinguished by the representation supplied to the multimodal Transformer. Encoder-full MLLMs receive continuous features from a dedicated perceptual encoder. Discrete-token MLLMs receive discrete perceptual codes, while encoder-free MLLMs receive lightly projected patches or frames. We ask whether the latter two families form a Virtual Encoder inside the Transformer.

arXiv

深度剖析

作者提出并命名了“虚拟编码器”这一计算结构:在只接收感知token、没有连续编码器派生特征的多模态模型中,共享Transformer的早到中层会自行构建任务可用的感知表示。 以往多模态语言模型默认由专用感知编码器负责构造可用表示,而更集成的架构把轻投影的图像块、音频帧或离散视觉token直接交给共享Transformer;该工作指出缺失的编码计算并未消失,而是被Transformer内部化。 摘要报告该结构通过线性探测、与感知编码器的相似性比较以及因果分析三类手段被识别出签名,但加载文本未给出具体模型、数据集或数值。

研究提示感知与语言处理的分界不必与架构模块边界重合,编码器式计算可以在共享Transformer内部作为一种功能状态涌现。 这为理解多模态模型“在哪里、如何”处理感知提供了新视角,把感知与语言的分工从模块层面移到功能层面。 该结论来自摘要所述三类分析的综合推断,属于对观察到的签名的一种解释性框架,而非单一实验的直接测量。

启示与展望

该工作面向接收感知token(轻投影的图像块、音频帧或离散视觉token)而不提供连续编码器派生特征的多模态Transformer,为分析这类集成式架构中感知表示在何处形成提供了框架;对采用此类架构的研究者与工程实践者,它提示可以把早到中层视为编码器式计算发生的区域,从而在探测、可解释性与架构设计上提出新的观察角度。

加载文本仅为arXiv摘要页,未包含具体模型、数据集、样本量或数值结果,因此无法判断该结构在不同模型与模态上的普遍程度;虚拟编码器与专用感知编码器在功能上等价到什么程度、其出现是否依赖特定训练方式,仍是值得关注的开放问题。

来源