UniData 用九模态流水线把简单需求变成多轮多模态指令,在合理性、清晰度、细节与相关性四项指标上超过 Self-Instruct 与 VIGC
核心概要
作者提出 UniData,一个通用多模态指令生成流水线:先把用户关键词扩展为多样事件,再用以 LLaMA-3 为骨干、结合图像与音乐分词器的多模态指令生成器逐轮生成指令,并在推理时按轮次相关性纠正重复与无关内容;配套构建含九种模态、2 万条、平均 17.5 轮的 UniDataset,实验显示其数据质量在合理性、清晰度、细节、相关性四项 GPT 引导指标上均优于 Self-Instruct 与 VIGC,且生成数据微调后能提升其他多模态模型的理解与生成表现。
Figure 1: Usage of UniData. (I) Users only input one simple requirement, combined with random emotions and occasions to create diverse events. (II) Each diverse event will generate one multimodal instruction. (III) The generated multimodal instructions include various modalities.
arXiv深度剖析
UniData 能从一条简单需求出发生成多轮、多模态指令,覆盖输入与输出两侧各九种模态,平均每段对话 17.5 轮,而 Self-Instruct 与 VIGC 仅支持语言或语言加图像且轮数更少。 此前 Self-Instruct 局限于语言模态,VIGC 引入视觉理解,Multimodal Self-Instruct 仅能生成抽象图像;UniData 把模态范围扩展到九种并支持长多轮生成。 表 1 与表 10 给出对比:UniData 平均 1.92 张图像、0.74 段音乐、7.37 个其他模态、17.5 轮,基线在图像与音乐列为空、轮数为 3 与 1。
在四项 GPT 引导质量指标上,UniData 全面超过两个基线,清晰度与相关性领先幅度最大。 基线方法此前未被在同一测试数据上以这四项指标统一比较,UniData 提供了这一横向对照。 表 1 中 UniData 为合理性 0.661、清晰度 0.527、细节 0.667、相关性 0.682,Self-Instruct 为 0.624/0.444/0.594/0.520,VIGC 为 0.460/0.359/0.534/0.569;附录 C.3 的 15 人强制选择用户研究显示 UniData 在每个维度被偏好。
用 UniData 生成的数据微调其他多模态模型,可在视觉理解、图像理解与生成、音乐、代码、数学及文本类基准上带来提升。 这检验的是生成数据对下游模型的可迁移价值,而不只是生成数据本身的质量评分。 表 7 显示 MMMU 35.8→36.4、ChartQA 17.4→17.9、TextVQA 58.9→60.1,MBPP 20.8→21.3,MathVista 59.4→60.1,MathVision 12.8→13.0,MMLU-Pro 20.3→21.9;图像理解交错设置 19.42%→35.25%;音乐指标中 FAD 与 KL 下降、CLAP 上升,作者说明音乐增益幅度较小。
消融实验表明事件扩展与指令流纠正各自贡献质量提升,去掉任一项四项指标均下降。 把流水线两个设计选择与最终数据质量建立了直接对照。 表 7 中 w/o Expansion 为 0.557/0.518/0.607/0.550,w/o Correction 为 0.648/0.489/0.610/0.654,完整方法为 0.661/0.527/0.667/0.682;作者还指出无扩展时生成指令数量显著减少。
启示与展望
该工作面向需要大规模多模态指令数据的 MLLM 训练与数据生产场景:用户给出少量关键词,即可得到多轮、九模态的指令集,并可按需偏向图像或音乐等特定模态(表 14 显示图像相关输入使图像数升至 14.90,音乐相关输入使音乐数升至 12.30)。作者把 UniData 定位为文本中心的编排流水线而非原生任意到任意模型,因此各模态质量受外部工具约束;流水线设计为可吸收新模态,第 3 阶段输出与模态无关的槽位,第 4 阶段可通过薄适配器接入新 API。作者列出的后续方向包括替换更大更新的骨干、接入视频、3D、动作与表格生成工具,以及让用户提供下游规格以生成定制数据。
质量评分依赖 GPT-4o 作为评判者,其偏好与人类判断的一致性仍是开放问题,尽管作者补充了 15 人用户研究。下游增益在多数基准上幅度有限,例如 MathVision 12.8→13.0、MMMU 35.8→36.4,这些提升是否在更大模型或更长训练下保持,文本未给出结论。指令流纠正目前只在文本提示层面进行,作者说明尚未把纠正器条件化于渲染后的媒体,因此重复或漂移在最终媒体层面是否仍存在值得关注。作者也指出九模态覆盖仍不含视频、3D、动作、表格、生物数据与语音输入,且流水线会继承 LLM 骨干、搜索 API 与模态生成器的偏差,系统性偏差审计留作未来工作。
