跳到主要内容
返回时间线
arXiv来源发表:

腾讯混元等团队用11档MoE模型对比发现:去掉视觉编码器后多模态损失随算力下降更快,约10^22 FLOPs处追平

核心概要

该工作在同一套11档稀疏MoE解码器阶梯(1.1B–44B总参数、71M–2.4B激活参数)、相同数据混合与优化设置下,分别拟合无编码器与有编码器多模态大模型的文本与多模态缩放律,发现去掉视觉编码器会把多模态目标的算力最优分配推向更大模型(模型分配指数由约0.464升至约0.570),文本目标几乎不变;无编码器模型在小规模下多模态损失更高,但其损失随算力下降更快,外推预测约在10^22 FLOPs量级(点估计约3.2×10^21 FLOPs)出现效率交叉,且解码器通过视觉token双向注意力、浅层提前改写视觉表示与专家路由集中化来接管视觉编码。

AI-generated editorial illustration: How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining

深度剖析

去掉视觉编码器改变了多模态目标的算力最优分配:模型分配指数从有编码器的约0.464升到无编码器的约0.570,数据分配指数相应从约0.536降到约0.430,而文本目标两者几乎一致(约0.427与约0.422)。 此前无编码器多模态模型的研究多停留在可行性、对齐或蒸馏层面,缺少与有编码器基线在同一解码器阶梯上的受控缩放对比;该工作用IsoFLOP剖面分别拟合文本与多模态目标的分配律,把“是否需要更大解码器”变成可量化的指数差异。 11档共享MoE解码器阶梯、相同数据混合与优化设置,视觉token粒度对齐;多模态分配指数差异经条件自助法给出中心区间(无编码器约0.570、有编码器约0.464),并在因果注意力变体下仍保持该偏移。

两种架构在文本目标上的损失–算力前沿几乎重合,但在多模态目标上分离:无编码器模型在测量范围内需要更多算力达到同等验证损失,但其损失–算力指数更大,外推预测约在10^22 FLOPs量级交叉(点估计约3.2×10^21 FLOPs,条件自助区间约1.6×10^21至1.1×10^22),过训练情形下交叉更晚。 以往工作多报告无编码器模型在给定规模下落后,该工作把差距放进缩放律外推框架,给出交叉发生的算力量级,并与近期旗舰模型约10^25 FLOPs量级的预训练算力作对照。 基于六个IsoFLOP最优点拟合的损失–算力律,留一预算重拟合把交叉放在约1.6×10^21至1.1×10^22 FLOPs之间;作者明确说明该外推假设拟合律在测量范围之外继续成立、视觉编码器尺寸固定、不可约损失仅由数据分布决定。

解码器通过视觉特异的适应接管视觉编码:视觉token之间的双向注意力随算力增长收益变大(因果注意力在文本上约省1.5%算力但多模态平均略差约0.5%),视觉表示在更浅层就偏离输入而文本轨迹两架构接近,视觉token的专家路由更集中(MaxVio更高、带宽更宽)。 这些内部探针把“解码器补偿缺失编码器”从推测变成可观测现象,并把效应定位到视觉处理而非全模型路由变化,因为文本token的路由在两架构间保持接近。 在8B模型上,无编码器模型第12层对视觉token的注意力从约0.2升到约0.6,接近有编码器模型;层间余弦相似度探针在多个模型规模上重复;专家负载不均衡用MaxVio度量,在四个最大模型规模上一致。

按主题拆分后,无编码器模型的追赶顺序不同:STEM最先接近持平,Charts差距收窄较快,GUI、OCR与Caption明显更晚;下游基准上无编码器模型在评测规模内仍低于有编码器模型,但差距随训练算力增加而收窄,在最大token预算下也随模型增大而收窄。 把总体多模态损失拆成主题,说明“何时追平”取决于该主题对预训练视觉表示的依赖程度,而不是一个统一的时间表。 主题级IsoFLOP剖面复用已有检查点、未训练新模型,部分主题最优点落在阶梯边缘并做了温和外推;下游评测为3-shot、无额外训练,报告了感知、文档理解与通用VQA多类基准的平均分。

启示与展望

该结果适用于以固定尺寸预训练视觉编码器、固定数据混合与固定MoE拓扑为条件的解码器缩放场景,主要面向从事多模态预训练架构与算力分配的研究与工程团队;它给出的是在测量范围内拟合、再外推到约10^22 FLOPs量级的预测,可用于判断在何种算力预算下值得投入无编码器路线,以及哪些主题(如STEM、Charts)会先接近持平。

交叉点依赖拟合律在测量范围之外继续成立、视觉编码器尺寸固定、不可约损失仅由数据分布决定等假设,作者也说明这些是结构性假设而非有限规模观测所能识别的渐近事实;指数与交叉点对不可约损失取值敏感,报告的是敏感性范围而非统计置信区间;主题级分析中部分最优点落在模型阶梯边缘并做了温和外推;下游评测在评测规模内仍显示无编码器模型落后,因此交叉预测尚待更大规模验证。

来源