MT-OPSD 用自生成状态上的在线自蒸馏,把开源图像编辑模型十轮编辑成功率从 0.03–0.15 提到 0.38–0.52
核心概要
该工作发现指令式图像编辑模型在递归多轮编辑中会快速退化,并将其归因于训练时只见过干净源图、推理时却要反复以自身不完美输出为条件的训练—测试条件分布错配,于是提出 MT-OPSD:用恒等指令让当前学生模型自我 rollout 出含自身误差的状态,再由以干净源图为条件的同一模型作为教师,通过稀疏速度匹配把干净条件下的编辑行为迁移到这些自生成状态上,无需多轮标注;同时构建含 100 个十轮编辑会话的 LME-Bench,在三个编辑骨干上把 SR@10 提升到 0.38–0.52、把 CR@10 降到不超过 0.04,并基本保持单轮编辑质量。
深度剖析
论文指出多轮编辑崩溃是跨模型的普遍现象,并把它归因于条件分布上的训练—测试错配:训练只以干净源图为条件,推理却要反复以自己上一轮的输出为条件,误差逐轮累积。 此前工作多把多轮退化当作模型个体问题或靠图像空间、潜空间的事后修正来缓解,这里给出统一的诊断视角,并用“即使要求原样复现输入也会逐轮漂移”的恒等 rollout 把模型自身引入的误差与指令带来的语义变化分离开来。 论文报告在多个编辑模型上观察到该行为,并给出恒等复现诊断;三个开源骨干在 LME-Bench 上 SR@10 降至 0.03–0.15、CR@10 升至 0.25–0.61。
提出 MT-OPSD 在线自蒸馏框架:学生以自生成 rollout 状态为条件,教师由同一预训练模型在干净源图条件下充当,通过稀疏查询的速度匹配把干净条件下的编辑行为迁移到退化状态上,不需要多轮标注或外部教师。 与依赖外部奖励的强化学习路线(如 MT-EditFlow)和需要配对目标图的视觉自蒸馏不同,这里把“干净源图”本身当作教师的特权上下文,学生上下文则是自身 rollout 状态;训练交替使用恒等分支抑制进一步漂移、编辑分支在自生成状态上保持可编辑性。 消融显示去掉编辑分支后 SR@10 降到 0.00、CR@10 升到 0.80;把在线速度匹配换成对教师伪目标的标准流匹配后 SR@5 从 0.91 降到 0.59、SR@10 从 0.44 降到 0.03、CR@10 从 0.02 升到 0.67。
引入 LME-Bench:100 个十轮编辑会话、共 1,000 条指令,每个会话含六个局部编辑与四个全局编辑,逐轮评估提示遵循、与上一状态的一致性和视觉质量,并给出 SR@t 与 CR@t 两个指标。 已有基准最多五轮,不足以刻画长程退化;该基准把全局编辑放在非相邻位置且不放在最后两轮,使后续局部编辑作用在已经历全局变换的图像上,并用六类有效性规则避免无效或歧义指令。 源图由 Z-Image-Turbo 生成、均匀分布在 10 个语义类别,指令先经 VLM 检查再人工复核;每轮由 GPT-4o 按 0–10 打分,提示遵循与一致性均不低于 7 才算成功,连续两轮被判退化才算崩溃。
在三个编辑骨干上,MT-OPSD 显著改善长程编辑成功率并降低崩溃率,同时基本保持单轮编辑能力。 训练时 rollout 课程通常约四轮就饱和,但收益在十轮评测中依然存在,说明从自生成状态学到的鲁棒性可以迁移到训练深度之外的真实多轮序列;训练免费方法的表现则依赖具体骨干。 LME-Bench 上 SR@10 提升到 0.38–0.52、CR@10 不超过 0.04;MSE-Bench 上 Qwen-Image-Edit-2511 的 SR@5 从 0.24 升到 0.51、FireRed-Image-Edit 从 0.40 升到 0.69,FLUX.2-klein-base 与基线持平在 0.49;ImgEdit 单轮分数仅有小幅变化。
启示与展望
该结果面向以流匹配为基础、可做 LoRA 微调的指令式图像编辑模型,适用于每轮只接收上一轮输出、不重新引入原始图像的多轮编辑设定;方法依赖模型本身已具备较强的单轮干净条件编辑能力,训练使用约 2,000 对来自 OmniEdit 的源图/指令对且不使用真值编辑图,教师晋升由 VLM 评委在 23 个十轮会话的留出闸门集上异步决定。LME-Bench 与闸门集源图由 Z-Image-Turbo 生成,评测由 GPT-4o 打分,因此该基准与指标可直接用于比较其他多轮编辑方法,也便于把同一思路扩展到视频或其他递归生成任务。
训练时 rollout 课程通常约四轮饱和,而收益在十轮评测中仍成立,这一外推的边界值得继续观察;恒等分支与编辑分支的取舍在消融中表现为成功率与可控性的权衡,不同应用可能偏好不同平衡点;教师晋升依赖 VLM 评委与留出闸门集,评委行为对结果的影响尚未在正文中展开;与专有系统相比,GPT-Image-2 与 Nano Banana Pro 在长程上仍更强,开源模型缩小差距的程度随骨干而异;此外,本次读取的是论文正文与附录文本,表格中的逐项数值未逐格核对,具体数字以原文表格为准。
