把强化学习更新搬进视觉语言模型:只留主方向,MathVision 反超完整迁移 8.55 个百分点
导语
把语言模型强化学习阶段的参数更新单独取出、只保留每个矩阵的主方向再按原幅度缩放后迁移到视觉语言模型的语言模块,在三个模型家族、五个视觉推理基准的 15 组比较中有 12 组优于完整更新插值,Qwen 接收方上 MathVision 提升 8.55 个百分点。
正文
跨模型迁移推理能力时,真正值得搬的是强化学习阶段新增的那部分参数变化,而不是供体与接收方之间的全部参数差。 此前的模型合并按供体与接收方的端点差构造位移,这个差里混着强化学习之前就存在的模型差异,无法区分哪些是后训练学到的。 把强化学习更新单独取出后,在 Qwen3-VL-8B-Instruct、LLaVA-NeXT-LLaMA3-8B、Idefics2-8B 三个接收方和五个视觉推理基准上,15 组比较中有 12 组优于共享同一参数支撑的完整更新插值。
做法是先取供体后训练检查点与其强化学习起点检查点之差,得到强化学习更新,再对每个可迁移的语言层矩阵做奇异值分解,只保留最大的那个奇异方向,并把它重新缩放到与原矩阵相同的 Frobenius 范数。 完整更新是按源语言模型优化的,其各个方向对多模态接收方未必同样有用;保留更多方向反而逐步降低 MathVista 准确率。 在 Qwen3-VL 上,范数匹配的主方向在 MathVista 上达到 81.00,十个匹配随机方向平均 74.1 左右,尾随方向为 73.10,而完整更新为 76.70。
接下来
下一步可以在更多语言-视觉组合和更多推理任务上检验主方向选择是否同样成立,尤其是 H2 与 H3 上出现退化的 MMStar 与 MathVision。做合并或迁移的工程师可以直接复用这套离线流程:分解、归一化、系数选择与检查点构造都在离线完成,检查点保持标准稠密结构,不引入额外推理模块。需要按任务核对收益,因为 15 组比较中有 3 组未超过完整更新。
主方向为何比完整更新更易迁移,材料只给出经验对照,未给出机制归因,这仍是开放问题。收益并非普遍:H2 在 MMStar 上下降,H3 在 MathVision 与 MMStar 上下降,读者应关注这些反转是否在更多骨干上重现。秩固定为一属于经验选择,秩从一增到十六准确率逐步下降,但材料未说明该规则在其他任务上的适用边界。源模型重建保真度与接收方收益是两类不同测量,不能互相替代。
