跳到主要内容
返回时间线
arXiv来源发表:

UMM-Reflection 用整条反思轨迹的强化学习把 BAGEL 的 GenEval 从 0.72 提到 0.84,修复率从 20.59% 升到 64.94%

核心概要

该工作提出 UMM-Reflection,在统一多模态模型 BAGEL 上先用反思轨迹做监督微调冷启动,再用整条轨迹级优势的强化学习同时更新反思文本与基于流的图像修订,使 GenEval 较 SFT 提升 12.05 分、条件修复率从 20.59% 升至 64.94%,并在未参与训练的 WISE(+10.97)、OneIG-Bench(+3.48)与 T2I-CompBench++(+4.63)上取得迁移增益。

AI-generated editorial illustration: Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning

深度剖析

把多轮反思做成可整体训练的强化学习目标:同一初始图像下采样多条兄弟轨迹,用组相对优势比较不同反思策略,并用一个轨迹级优势同时更新反思 token 与流式修订,避免逐轮信用分配的组数爆炸。 此前统一模型一侧只对单次渲染做 RL(如 T2I-R1、ReasonGen-R1、UniRL),另一侧靠模仿多轮推理—编辑轨迹(如 Thinking with Generated Images、MINT、Uni-CoT、IRG、ThinkMorph、UniT),没有对自身多轮反思做结果驱动的 RL。 论文给出方法推导与消融:仅训流头接近 SFT(73,修复率 22.8%),仅训文本头恢复大部分增益(78,49.4%),联合训练达 84 与 64.9%;训练用 3,000 条提示池、每次更新 2 个根与每根 16 条兄弟轨迹、1,000 次更新。

区分了“能产出有用修订”与“能可靠选中修订”:SFT 已学到协议(95% 轨迹合规)且 rollout 中已含正确修复,但单条 SFT 轨迹只修复 20.59% 的初始错误图像,RL 后升至 64.94%。 把 SCoRe 关于在线多轮 RL 必要性的判断,从语言自校正迁移到统一模型的图像反思,并给出量化证据。 GenEval 553 条提示上 RL 对 SFT 为 109 胜 38 负(McNemar),初始图像上为 48–32 且不显著,说明增益来自反思轮次;训练日志显示 pass@1 从 22.7% 升到 70.1%,pass@16 仅从 77.6% 升到 97.1%。

增益可迁移且不需要推理期验证器:同一检查点在训练未见的 WISE、OneIG-Bench、T2I-CompBench++ 上均优于反思 SFT,推理时只运行统一模型本身。 与依赖外部批评者并让其常驻推理的流水线(Idea2Img、ReflectionFlow、SLD、GenArtist 等)不同,这里两个角色是同一策略,验证器只在训练时使用。 WISE +10.97、CompBench +4.63、OneIG +3.48;外部 GPT-5.5 批评者流水线在 GenEval 为 79、修复率 27.6%,UMM-Reflection 为 84 与 64.9%。

机制分析显示 RL 并未创造新能力,而是把策略推向骨干已有的正确区域:理解流的正确性线性探针 AUC 在 Base/SFT/RL 下为 0.804/0.807/0.815,几乎不变,而初始失败图像落入该读出“通过密集区”的比例从 34% 升到 62%(SFT 为 36% 到 42%)。 为“RL 选择而非创造”这一读法提供了表征层面的证据,并解释了为何 3,000 条提示池上 1,000 次更新即可奏效。 回放全部 553 条轨迹;在双方都用三次编辑的 153 条提示上,DINO 距离 0.11 对 0.28(配对差 0.17,95% CI [0.13, 0.21]);固定图像、渲染器与噪声只换指令时,RL 指令修复 48.4%,原请求 20.5%,规则化指令 27.6%。

启示与展望

该结果面向具备理解与生成双能力的统一多模态模型,尤其是采用流匹配渲染器的骨干;训练需要冻结验证器提供分级奖励,推理时只需模型自身。方法在 BAGEL 上以 3,000 条 GenEval 风格提示池、1,000 次更新、最多三轮修复、训练分辨率 512 与推理 50 步去噪的设定下验证,适用于组合式文生图的对齐修复场景。对希望减少外部批评者依赖、把多轮反思纳入训练闭环的团队,这套协议与奖励设计可直接复用;计数类编辑被作者标为下一个训练目标,同一奖励与协议无需改动即可套用。

评测采用受控协议(指令语气提示、512 分辨率、每提示一张图),与各基准原生排行榜协议不同,跨论文比较需谨慎;OneIG 报告的是 695 条合格提示上的问题依赖对齐分而非整体分数,WISE 报告加权组聚合而非汇总准确率。计数族在 1,000 次更新中训练奖励持平、GenEval 准确率停在 67.5,说明该族尚未被现有编辑动作覆盖。此外,SFT 轨迹由 GPT-5.5 与 Qwen-Image 系列外部模型蒸馏而来,监督数据的风格与覆盖范围会影响冷启动质量;停止行为的定价也敏感,加入正确 DONE 奖励会让策略过早停止并把准确率从 82 降到 79。

来源