跳到主要内容
返回时间线
arXiv来源发表:

Multimodal Flow 用连续超块流匹配统一语言与视觉,MF-1 以 150B token 在 GenEval 得 0.821、DPG-Bench 得 83.44

核心概要

该工作提出 Multimodal Flow,把文本块与图像编码为有序连续超块,用共享的 chunk-causal Flow Matching 骨干在各自嵌入空间建模语言与视觉,并实例化为 MF-1:在 0.6B、1.2B、1.6B 规模上持续预训练稳定提升多模态建模,1.6B 模型仅用 150B 预训练 token 即在 GenEval 得 0.821、DPG-Bench 得 83.44,在 VQAv2、MMBench、POPE 上平均 75.3,并在匹配数据、优化与参数预算下优于代表性混合式与离散式模型。

AI-generated editorial illustration: Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces

深度剖析

提出完全连续的统一多模态建模范式:文本块与图像分别经模态专属编码器映射为连续嵌入,组成保留文本 token 顺序与视觉网格结构的“超块”,由同一个 chunk-causal Flow Matching 骨干学习单一向量场。 此前统一模型要么把图像量化成离散视觉 token(存在视觉量化瓶颈),要么用离散语言预测搭配连续图像生成(需要模态相关目标与采样流程);该工作让两种模态共享连续目标与采样机制,同时保留各自的表示统计。 论文给出完整架构描述:冻结的 SigLIP 2 与 T5-small 编码器、冻结的图像解码器与单独训练的文本解码器,文本块长度为 8,图像为 256 个 patch 嵌入的单一空间块,并给出 Flow Matching 概率路径与训练目标公式。

设计有序超块与 chunk-causal 骨干:预测某一块时可见全部前序块、块内位置联合建模,训练时并行预测多个目标块,推理时按任务顺序逐块生成并可用 KV 缓存。 把多模态任务统一表达为任务定义的有序超块序列,使同一骨干在文本到图像、图像到文本、纯文本、纯图像等不同上下文下工作,而无需改变模型接口或目标函数。 论文给出 chunk 顺序分解公式、并行训练目标、序列打包到最多 32768 个模型位置的做法,以及推理时逐块积分向量场并缓存已完成块键值的流程。

实例化 MF-1 并验证扩展性、竞争力与迁移性:0.6B、1.2B、1.6B 变体在相同混合预训练与评测协议下,Flow Matching 目标与语言困惑度下降、GenEval 与 CLIPScore 上升;1.6B 模型在 GenEval 得 0.821、DPG-Bench 得 83.44,在 VQAv2、MMBench、POPE 上平均 75.3。 在仅 150B 预训练 token 的从零训练设定下,MF-1 超过 Muddit、D-DiT 等从零训练的统一模型,并与由预训练 LLM 初始化的同规模模型保持竞争力;在匹配数据、优化与可训练参数预算下,MF-1 在 GenEval 0.7134、GQA 55.60、VQAv2 69.03、MMBench 46.74、SEEDB 51.85 上优于 Transfusion 式混合架构与 Chameleon 式全离散架构。 论文报告了 1.6B 骨干、150B 预训练 token 加 5B 联合微调 token 的主结果表,以及 50B 预训练加 5B 微调、可训练参数量与 MF-1 相差不超过 0.00156% 的受控架构对比表。

混合预训练带来可迁移收益,并给出设计分析:在 1.6B 架构与匹配总训练 token 预算下,混合预训练相对随机初始化把 SeedBench 从 31.6 提升到 62.4、MMBench 从 36.0 提升到 67.2;语义视觉表示优于重建导向的 VAE 表示,模态专属 FFN 优于共享 FFN,同一 CFG 机制可同时改善文本到图像与图像条件文本生成。 说明收益来自混合预训练本身而非更多 token 暴露,并把连续视觉表示空间、共享与模态专属计算的划分、以及双向 CFG 作为可复用的设计选择呈现出来。 论文给出随机初始化与混合预训练在 GenEval、DPG-Bench、SEEDB、MMB、OK-VQA 上的对照表,DINOv2 与 SigLIP2 对比 FLUX.2 VAE、SD-VAE 潜变量与原始图像块的表示分析,四种参数匹配的注意力投影与 FFN 配置表,以及 0.6B 模型上图像描述在引导尺度 3、文本到图像在引导尺度 5 时最佳的扫描结果。

启示与展望

该结果面向以文本与图像为对象的统一多模态预训练与下游微调:视觉问答与文本到图像生成被表达为有序超块序列,任务数据与优化改变而块接口、因果分解与连续目标保持不变。它使研究者可以在同一骨干上混合纯文本、纯图像、图像到文本与文本到图像数据,并复用冻结的模态编解码器;对希望以较少预训练 token 从零训练统一模型的团队,MF-1 的 150B token 设定与公开代码、模型提供了可复现的起点。作者把更长的交错序列、视频与其他结构化模态列为后续方向。

需要留意的是,主结果表使用 150B 预训练 token 加 5B 联合微调的同一检查点,而受控架构对比与设计分析使用 50B 预训练设定,两者预算不同,跨表比较时应区分。语言建模以 GPT-2-large 困惑度作为外部流畅度指标而非流模型自身似然,图像描述在 COCO Karpathy 测试划分上以 CIDEr 与 CLIPScore 衡量。视觉表示与 CFG 分析基于 0.6B 模型且不做下游微调,其结论是否随规模变化仍是开放问题。此外,本次读取为全文,但公式与部分表格在文本中以占位形式出现,具体数值以正文叙述与表格为准。

来源