同一奖励、不同技能:多模态强化学习何时学会“看”
相关研究与后续进展核心概要
该研究提出“视觉可解性”设计规则,要求正确答案必须依赖视觉证据且任务可学习,并在反事实坐标场景上用标准 GRPO 与正确性加格式奖励训练 Qwen2.5-VL-7B:在比训练更密集的留出 20 点场景上,发现目标准确率从 0.425 升至 0.875;把测试图像换成灰色画布后准确率降为零,而用灰色画布训练在匹配的第 30 步、四个随机种子下几乎不产生该增益,说明增益来自训练图像;在相同图像、奖励与预算下加入能回答训练问题的说明文字,增益减少近三分之二。
Figure 1: Same learning rule, different lessons. Left: shortcut-accessible tasks allow reward without visual evidence; gains in the reported 3B comparisons mainly favor cued readout. Right: constructed tasks demand visual evidence and relation-based target identification; discovery, cued readout, and named-target grounding improve. The hierarchy distinguishes supplied locations, supplied identities, and relation-defined targets. GRPO is shared across the study; rewards stay fixed within matched comparisons.
arXiv深度剖析
在普通 RLVR 设置下,视觉基准分数的提升并不等于模型从图像中学到了视觉操作:在 Geometry3K 上把训练图像全部替换为灰色画布,3B 模型仍能恢复真实图像训练增益的约一半,7B 模型恢复近五分之四(7B 恢复份额 0.78,95% CI [0.64, 0.92])。 此前对视觉推理基准提升的解读通常默认奖励正确答案会发展出所需的视觉操作;该工作通过训练期与测试期视觉访问的交叉对照,把“测试时依赖图像”与“从图像中学习”区分开来。 3B 条件下三个种子、四个视觉访问条件(Real/Caption/None/Gray)的对照实验,报告了增益与恢复份额;7B 给出恢复份额及其自助法区间。
按“视觉可解性”构造的反事实坐标任务(问题固定、目标不被命名、只给关系)能让 7B 模型在留出的 20 点确认集上把发现准确率从 0.425 提升到 0.875(增益 0.450,95% CI [0.365, 0.540]),并迁移到从未训练的提示读值与命名目标定位,以及独立构造的坐标定位任务(配对准确率从 0.768 升至 0.948)。 与仅靠奖励工程或数据选择不同,该工作把“成功作答需要哪种视觉操作”写进任务构造,并用线索层级(L1 标记位置、L2 命名目标、L3 只给关系)区分所测操作。 四个随机种子、五个运行,确认集与未触碰集(1,332 个成员)上 Real 超过 Gray 分别为 +0.354(种子标准差 0.019)与 +0.339(标准差 0.021);迁移任务在训练语料之前构造且从未用于训练。
两个对照定位增益来源:测试图像换成灰色画布后发现与识别探针准确率精确为零;用灰色画布训练(相同提示、起点、奖励与预算)在匹配第 30 步、四个种子下几乎不产生发现增益,说明增益来自训练期视觉信息。 这组匹配的盲训练对照把“模型在测试时使用图像”与“模型从图像中学到技能”分开,而此前的视觉中心任务构造未做这一测量。 Real 与 Gray 在相同评估条件下配对比较,种子级区间 [0.323, 0.384];灰色画布下模型给出固定默认答案而非拒答。
在相同图像、奖励与预算下,把能回答训练问题的说明文字加入提示,模型仍能获得奖励(第 30 步准确率分量 0.97–0.99),但确认集发现增益仅 +0.120,而 Real 为 +0.323,差距 +0.203(种子级 95% CI [+0.163, +0.243])。 该“捷径可及”对照表明,改变奖励所要求的东西会改变 RL 学到的技能,即使奖励数值本身相同。 三个种子,每个捷径种子都低于每个 Real 种子;测试时即使附带说明文字,最高也只到 0.655,仍低于 Real 仅用图像的水平。
启示与展望
该结果面向使用可验证奖励训练视觉语言模型的研究者与工程师,适用于视觉必要性可被直接测量和控制的受控测试台(反事实坐标场景)。在此设置下,训练视觉编码器与投影层保持冻结、只训练语言模型,因此“学会看”表现为学会去看:同一图像在训练前后提供相同的视觉 token。该原则的下一步检验是把它应用到其他视觉格式与自然图像,那里必须先测量视觉必要性;作者也提出把同一思路扩展到音频、视频与工具使用等以证据而非像素为中心的任务。
读者仍需关注:坐标场景是刻意设计的测试台,向自然图像与其他视觉格式的推广尚未验证;长时程腐蚀实验同时改变了训练时长、编码器可训练性、语料过滤与奖励实现,因此展示的是该配方下的损失而非单一原因;答案匹配器修订会影响共享错误集合的解读(当前修订使图像移除后的准确率下降、增益上升);确认集标准中“伪影筛查需在三个种子均通过”的要求是在生成开始之后、评估之前加入的;此外,训练奖励在第 13 步即超过 0.97,而发现能力持续提升到第 75 步,说明奖励饱和不是学习停止的信号。
