跳到主要内容
返回时间线
arXiv来源发表:

UniEvo-VL 让多模态模型用自己的批评做老师,GenEval 从 0.747 升到 0.808

核心概要

UniEvo-VL 提出一种在线策略自蒸馏(OPSD)训练配方:让同一个多模态模型分别扮演只看原始提示的学生和额外看到批评改写提示的老师,在学生的去噪轨迹上最小化两者逐状态分布差异,在 Qwen-Image-2512 上把 GenEval 从 0.747 提升到 0.808、GenEval2 Soft-TIFA 从 32.97 提升到 35.53,并显示更强外部批评者(GPT5.6-Luna)可带来更高上限,而文本渲染等任务的收益并不一致。

AI-generated editorial illustration: UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement

深度剖析

论文提出 UniEvo-VL,把视觉批评转化为监督信号:理解模式对生成图像给出接受或需修改的判断与纠正反馈,反馈被合成为改写提示,只作为老师的特权条件,学生仍只看到原始提示。 作者指出,此前的自增强、偏好优化、反思微调或测试时策略优化并未把纠正性条件直接蒸馏进原始提示的生成策略及其自身采样轨迹;UniEvo-VL 用同一模型的两个上下文角色替代独立的大教师模型。 方法在论文第 2 节给出完整形式化,包括提示合成公式、教师/学生策略定义与逐状态散度目标;实现细节、超参与随机种子列在附录 A。

训练目标是在学生自己的去噪轨迹上匹配教师与学生的局部预测,梯度只流向学生,教师为固定全分布目标,且不需要修正后的图像作为训练目标或标量奖励。 与依赖奖励梯度或图像级奖励的扩散/流模型优化不同,这里的目标来自以纠正文本为条件的教师预测,无需通过批评者反传梯度,也不需要可微图像奖励。 流式实现使用确定性转移匹配(速度匹配按采样区间平方加权),论文明确说明这不是精确的随机策略 KL 或 JS 散度;仅更新生成器 LoRA 参数,基础权重、文本编码器、VAE 与反馈组件保持固定。

在 Qwen-Image-2512 上,直接生成性能从 GenEval 0.747 提升到 0.808,GenEval2 Soft-TIFA 从 32.97 提升到 35.53;加入修订后验证的配置在三个任务的所有列示指标上都超过基线。 论文把训练带来的提升与推理时反思带来的提升分开评估,并用配对评估显示训练后反思仍然有效,说明训练获得的能力不能仅由推理时提示改写解释。 结果来自 GenEval、GenEval2 与 OCR 三个基准的配对评估,评估使用 Gemini-2.5-Flash 作为自动评判,HumanPref 为自动视觉质量代理而非人工标注研究。

批评者能力影响自进化上限:使用 GPT-5.6-Luna 反馈时 GenEval 原生分达到 0.882、GenEval2 达到 35.53,而 Qwen-VL 反馈在 GenEval2 上为 32.37;同时文本渲染等任务结果混杂,收益并不均匀。 论文把批评者选择作为变量,报告了类别级差异(如空间位置、计数、双物体与颜色),并指出 GenEval2 的位置与属性类别提升有限。 类别级分数与 Soft-TIFA GM/AM 数值在表 3 与附录 D.6 给出;作者也说明这些是历史子集与特定配置下的结果,且不同配置在不同指标上各有领先。

启示与展望

这项工作面向具备生成与理解两种模式的统一多模态模型,在测试时从自身批评中积累纠正经验,适用于组合式图像生成与视觉文本渲染等有明确文本规格的任务。论文验证的是基于流的 Qwen-Image-2512 实例,训练只更新生成器 LoRA,批评与提示合成组件保持固定;作者指出自回归扩展需要在共享前缀与词表上另行定义下一 token 分布损失。对使用者而言,这意味着该配方在已有强理解分支、且能产出可执行纠正文本的模型上最容易落地,并且批评者越强,可预期的自进化上限越高。

论文报告的是特定模型与配置下的结果,不同配置在不同指标上各有领先,因此不宜把单一数值当作普遍结论。收益在任务间并不均匀:文本渲染结果混杂,GenEval2 的位置与属性类别提升有限,训练还会在初始较易的提示上带来小幅回退。批评质量本身是关键变量,作者也把“什么样的自身反馈足够可靠到可以学习”作为开放问题提出;此外,评估依赖自动评判与自动视觉质量代理,GenEval 的检测器误差可能惩罚实际满足提示的图像,这些都属于读者在解读分数时需要留意的范围。

来源