跳到主要内容
返回时间线
arXiv来源发表:

Where-OPD 用程序生成场景的空间提示做在线自蒸馏,在三个多模态模型上把真实图像平均分提高 3.23、1.07、1.29 分

核心概要

该工作提出 Where-OPD:在在线自蒸馏中让教师模型额外获得文本形式的空间提示(指出与问题相关的视觉元素及其坐标),学生模型只看图像和问题;训练数据由程序化生成的几何图形计数场景自动产生,无需人工标注或外部教师模型,在 Qwen3.5-4B、Qwen3.5-9B 和 Qwen3-VL-4B 上改善了计数、文档与图表理解基准,并在仅用合成场景训练的情况下把 CVBench、V*、ZoomBench、BLINK、HR-Bench、MME-RealWorld 等真实图像基准的平均分分别提高 3.23、1.07、1.29 分。

AI-generated editorial illustration: Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes

深度剖析

提出一种新的特权信息形式:教师模型获得的是文本化的空间提示,指明与问题相关的视觉元素及其位置,而不是获得裁剪或放大的图像视图。 此前的多模态在线自蒸馏(如 Vision-OPD、Imagine-OPD、OPD-V、RP-OPSD、S2VOPD、VCSD)主要通过给教师更好的视觉观察来制造师生差异;本文保持图像不变,把差异放在文本空间指引上。 论文在 Qwen3.5-4B、Qwen3.5-9B、Qwen3-VL-4B 三个模型上与 Vision-OPD、OPD-V、Imagine-OPD、S2VOPD 对比,并给出消融:无特权信息时 OPSD 平均分与基座持平,仅给答案得 71.27,仅给坐标不给总数得 72.35,坐标加总数得 72.94(七基准平均)。

训练数据完全程序化生成:场景由彩色几何图形构成,物体身份、属性与坐标在生成时即已知,因此空间提示可自动构造,无需人工标注、区域提议或外部大模型。 既有方法依赖人工标注的 grounding 数据或外部教师模型来定位相关区域;本文用生成器状态直接导出提示,使后训练可规模化且无标注。 主训练集为 3,000 个图像—问题对,场景含 12 至 40 个物体、半径 14 至 64 像素、七种形状与十二种颜色;提示由固定模板生成,例如“Scanning for green crosses: found one near (377, 400), found one near (213, 805). Counting: 2 total.”。

合成场景训练带来的提升可迁移到真实图像与训练任务之外的视觉能力。 此前基于视觉放大的方法收益集中在受益于局部放大的任务上;本文报告在计数、文档、图表以及通用感知基准上均有改善。 论文报告 CVBench、V*、ZoomBench、BLINK、HR-Bench、MME-RealWorld 平均提升 3.23 分,三个模型分别为 3.23、1.07、1.29 分;Qwen3.5-4B 上 ChartQA 与 EvoChart 分别提升 7.20 与 10.11 分,CountQA 与 OCRBench 提升 2.53 与 1.93 分;分类别结果显示 MME-RealWorld 的自动驾驶子类提升 24.70 分。

设计选择被系统检验:冻结教师优于 EMA 更新,3,000 条数据在测试规模中平均分最高,默认分辨率与物体数量设置最优。 把“特权信息该是什么”这一问题拆成可测量的消融,而不仅是端到端报告。 教师更新率 0(冻结)在 Qwen3.5-4B 上得 72.94,随更新率增大平均分下降;数据规模消融显示 3,000 条在 Qwen3.5-4B 与 Qwen3-VL-4B 上均为测试规模中最高;场景生成消融显示默认分辨率与 12–40 物体设置平均分最高。

启示与展望

该结果面向希望以低成本后训练提升多模态模型视觉定位与证据整合能力的研究者与工程团队,适用场景是具备可程序化生成、且物体身份与坐标已知的训练环境;论文用计数问题作为监督载体,因为回答计数需要识别所有匹配实例,从而天然覆盖多个相关图像位置。方法在推理时不使用提示,学生只接收图像与问题,因此部署开销与基座模型一致。论文报告的训练成本为 4 张 H100 上约 1.4 小时(Qwen3.5-4B)、1.2 小时(Qwen3-VL-4B)、5.8 小时(Qwen3.5-9B)。

读者仍会关心:空间提示的收益在多大程度上依赖“计数”这一需要枚举多处的任务形态,若换成需要长链推理或外部知识的任务,提示模板是否仍适用;论文提到 CountQA 在更密集场景中受益,说明场景参数与具体基准之间存在取舍,最优配置可能随目标能力变化;教师更新率增大导致平均分下降,作者推测与合成图像上的域偏移有关,这一解释尚待进一步验证;此外,主结果中仅 Qwen3.5-4B 与 Qwen3.5-9B 的 Where-OPD 结果为三次独立训练的平均,其余后训练结果、消融与分析均来自单次运行,因此逐项差异的稳定性需要更多重复实验来确认。

来源