跳到主要内容
返回时间线
arXiv来源发表:

OmniTaskonomy 用 19 个生成任务对 25 项理解能力做迁移测绘:先做 I2I 再微调 I2T 可让理解提升,且梯度对齐与增益正相关

核心概要

作者在统一多模态模型 BAGEL 上构建成对的图像到图像(I2I)生成与图像到文本(I2T)理解任务,发现以 I2I 训练更新共享参数、再做 I2T 微调的配方能随 I2I 数据增加而稳定提升理解表现,并据此建立覆盖 19 个 I2I 任务与 25 项理解能力的 OmniTaskonomy 分类体系,绘制出选择性、任务依赖的生成到理解迁移图,同时发现生成与理解梯度对齐更强之处对应更大的下游迁移增益。

AI-generated editorial illustration: OmniTaskonomy: When Does Visual Generation Improve Visual Understanding?

深度剖析

在成对任务上,I2I 训练可以提升对应的 I2T 理解表现,且增益随 I2I 数据量增加而增大;直接混合两种目标或冻结共享参数则增益更弱或不稳定。 此前工作多显示理解有助于生成,而反向迁移不清楚,甚至有观点认为生成对理解帮助有限;该工作用同一输入、同一视觉问题、仅改变输出模态的受控配对设计,把这一不对称问题变成可测量的训练配方问题。 在 BAGEL-7B-MoT 上对 Jigsaw 与 Zoom-In 两个任务比较六种训练配方,固定 I2T 预算为 1k 样本并变化 I2I 数据量,每个结果取三个随机种子的均值并给出标准误;默认配方为 I2I 后接 I2T。

I2I 监督可以部分替代直接的 I2T 监督,理解数据越少时收益越大。 这给出了生成数据在理解数据稀缺时的具体价值量级,而不只是方向性结论。 固定 100k I2I 样本,与 I2T-only 在 1k、3k、10k、30k 预算下比较:Zoom-In 上 100k I2I 加 1k I2T 达到与 10k I2T 单独训练相当的表现,Jigsaw 上 100k I2I 加 3k I2T 达到与 10k I2T 相当的表现。

OmniTaskonomy 把 19 个 I2I 任务与 25 项理解能力放进同一套基于能力的分类体系,迁移图显示收益高度非均匀:metric 3D relation 与 counting 受益来源最广(各 12 个 I2I 任务),2D ordering 次之(11 个),而 OCR、文本识别、appearance understanding 未从任何被测来源显著提升。 以往基准按任务形式或输出模态组织,生成与理解任务彼此分离;该体系按共享视觉能力(Recognition、Reconstruction、Reorganization)对齐两类任务,使跨模态迁移可以在单项能力层面被测量。 分类体系由七个视觉语言基准的样本自下而上归纳,经三名 VLM 评审多数投票保留 9,444 个样本(93.30% 一致、6.70% 两票一致),并由四名人工评审 250 个样本验证,确定判断中 97.4% 与 VLM 标签一致。

迁移既出现在能力相近的任务之间,也出现在不那么直接的组合上;梯度对齐与迁移增益正相关。 这为“哪些生成任务值得选”提供了可检验的优化层面信号,而不仅是经验性的任务配对表。 在受控配对中,I2I 与 I2T 梯度对齐最强出现在理解分支的 pre-attention RMSNorm 参数、尤其是较早的 Transformer 层;跨任务分析中,七项能力的平均对齐与平均迁移增益正相关,133 个源—目标对的逐对对齐与增益也正相关,迁移显著性用配对置换检验评估。

启示与展望

该结果面向在同一模型内同时学习生成与理解的统一多模态模型,尤其是采用 Mixture-of-Transformers 架构、生成与理解分支共享注意力的设定;它说明在理解数据有限时,可以先用生成训练建立有用的初始化,再按目标能力选择生成任务,并用梯度对齐作为筛选任务配对的信号。迁移图覆盖 19 个 I2I 任务与 25 项理解能力,评估语料为七个基准的 9,444 个样本,因此其适用场景是这些能力与任务范围内的视觉理解评测。

迁移图显示收益高度非均匀,OCR、文本识别与 appearance understanding 未从任何被测来源显著提升,哪些能力本质上难以从生成监督中获益仍是开放问题。梯度对齐与迁移增益之间是正相关关联,文本并未给出因果机制,因此对齐能否作为事前筛选工具仍需前瞻性验证。受控配对实验只在 Jigsaw 与 Zoom-In 两个任务上展开,跨任务分析使用约 50k I2I 加 50k LLaVA-Instruct 的固定预算,更大数据规模与其他架构下的表现有待检验。分类体系依赖 VLM 标注与人工复核,虽然一致率很高,但能力边界的划分仍带有定义选择。

来源