ReaLVR 用视觉证据监督潜空间推理,在 Qwen2.5-VL-7B 上取得 63.7% 五任务均值并把潜空间视觉推理扩展到 235B
核心概要
该工作先分析潜视觉推理(LVR)中潜 token 的行为,指出存在“潜证据—信用缺口”——潜 token 对改变正确答案的图像扰动反应很弱,并认为这源于 GRPO 训练缺少显式监督;为此提出 ReaLVR,在模型自身自由运行的潜轨迹上引入视觉证据监督,用正确与错误答案的对比决定哪些位置需要更强监督、用相关与不匹配视觉证据的对比决定应保留什么,在三个模型家族上一致优于所评估的 LVR 基线,Qwen2.5-VL-7B 上五任务平均达 63.7%,并首次把潜空间视觉推理扩展到 235B 参数规模。
深度剖析
论文识别出“潜证据—信用缺口”:潜 token 对改变正确答案的图像扰动反应很弱,说明仅凭最终答案奖励无法指导潜 token 保留哪些视觉证据、如何分配信用。 此前 LVR 工作主要关注潜轨迹的形式与灵活性,或仅以最终答案准确率评估;该工作把诊断推进到潜 token 是否响应答案相关视觉证据这一层面。 基于受控的行为与表征测试:四类图像编辑各含 512 对原始—编辑样本且问题固定,正确答案在多数对中发生变化,而 LVR 仅在少数对中改变预测;自由运行的潜状态与视觉目标的余弦相似度也偏低。
提出 ReaLVR:在模型自己重新生成的、保留梯度的潜轨迹上施加视觉证据监督,用正确与错误答案的注意力读出差异定位需要更强监督的位置,用相关视觉原型与不匹配原型的对比规定应保留的内容。 与仅优化生成文本的 GRPO 不同,ReaLVR 让证据损失的梯度穿过潜 token 的生成过程;与均匀分配监督相比,按答案对比分配监督更有效。 组件消融显示:均匀路由平均低 1.3 分、仅用原始注意力为 62.9、去掉负样本为 62.1、监督已保存的离线潜状态为 61.9、去掉停止梯度为 62.6,完整方法为 63.7;方法不改变模型架构与推理流程。
在三个模型家族、六个骨干上一致优于所评估的 LVR 基线,并首次在 235B 参数的多模态骨干上训练潜空间视觉推理。 此前潜空间视觉推理的验证规模有限,该工作把证据监督扩展到前沿规模,并报告在 Qwen3-VL-235B 上于三个基准上均优于 LVR-SFT。 Qwen2.5-VL-7B 上五任务平均 63.7%,为所评估潜推理方法中最高;Qwen3-VL-30B 上达 65.2%,比 LVR 高 1.1 分;InternVL3-8B 与 Gemma-3-12B 上五任务均值分别超过 LVR-RL 若干分;235B 仅评估 MMVP、BLINK、MME-RealWorld 三项,无五任务均值。
机制分析显示 ReaLVR 的潜 token 位置对问题更敏感、与相关视觉区域对齐更强、被答案读取最多的潜 token 对答案似然更具承载作用。 这些分析把评估从基准准确率推进到潜状态的变异、接地与使用三个可分别测量的维度。 目标区域注意力富集在中层约为 2 倍,而 Monet 接近 1、LVR 在 1 或以下;替换被答案读取最多的八个潜 token 后,ReaLVR 正确答案概率从约 0.9 降至约 0.3;线性探针可从平均潜状态恢复 BLINK 任务标签,而词表读出并不暴露语言化推理链。
启示与展望
该结果面向使用连续潜 token 进行多模态推理的研究与工程场景:当区域标注可用时,视觉证据目标更具体;当标注缺失或掩码为空时,目标退化为整图原型,空间特异性下降。方法适用于已有两阶段 LVR 训练流程的骨干,训练侧需要能重新生成潜轨迹并保留梯度,推理侧仍按原 LVR 流程生成潜 token 并解码答案,因此可直接替换现有 LVR 训练环节。对希望在不改变推理接口的前提下提升视觉接地与答案对潜状态依赖的团队,这一监督方式提供了可迁移的起点;对关注潜推理可解释性的读者,文中给出的变异、接地与固定上下文替换三类诊断可作为评估模板。
潜 token 的词表读出并不呈现语言化推理链,其最高概率 token 与结束标记先验相关,因此“潜状态是否承载可读推理”仍是开放问题;固定上下文替换只测量局部答案依赖,重新生成后续状态可能带来额外影响。目标区域注意力富集在正确与错误回答上曲线相近,说明看向正确区域并不足以保证答对。潜长度消融显示最优预算随任务而异,当前推理仍使用预设的潜 token 预算,自适应预算尚待解决。此外,235B 规模仅评估三个基准,未报告五任务均值;本文所依据的文本为完整正文,但部分表格数值在正文叙述中以占位形式呈现,具体数字需以原表为准。
