VQS 用程序从图像结构化记录中算出答案,把自进化视觉语言模型的伪标签错误率从 24% 降到 6%
核心概要
VQS 让模型先把图像解析成场景图、图表表格或图示图等结构化记录,再由固定程序模板据此生成问题并计算答案,模型只逐条核验程序读取的原子事实,人工评估显示其答案正确率 94.4%(多数投票为 76.4%、模型裁判为 82.2%),在十个基准上把 Qwen3-VL 的 2B、4B、8B 平均分最多提升 3.18 分,三轮训练后在 2B 上达到 3.84 分。
深度剖析
VQS 把自进化问答的答案来源从模型输出改为程序计算:解析器把照片、图表、图示和信息图转成结构化记录,固定模板遍历记录生成问题并算出答案,模型只作为检查器逐条确认程序读取的原子事实。 此前自进化方法(VisPlay、R-Zero、EvoLMM、iReasoner、Vision-Zero、VISE)在无金标准答案时依赖多数投票、推理步骤一致、图像变换一致性或模型裁判等代理标签;VQS 改为在受约束解码保证格式合法的解析结果上运行确定性程序。 论文在 500 道共享问题上做人工评估,VQS 答案正确率 94.4%,多数投票 76.4%,模型裁判 82.2%;VQS 保留 76% 的问题,多数投票保留 92.0%,模型裁判保留 90.8%。
逐条声明级核验同时被用来无标签地挑选解析器的训练目标,使解析器本身变准。 论文比较了随机解析、整体一次性通过检查的解析、以及被核验声明比例最高的解析三种选择规则,并用手工标注衡量解析精度与答案准确率。 在 150 个样本上,逐声明核验把解析精度从整体核验的 85.0 提到 87.6,答案准确率从 94.0 提到 96.1;对 GQA 场景图、ChartQA 表格、AI2D-RST 图示标注的 F1 分别提升 5.0、6.6、7.4 分。
在十个基准、三个模型规模上,VQS 的平均增益都超过所比较的自进化基线,且增益随训练轮次继续增长。 论文报告 VQS 在 2B、4B、8B 上分别比基座提升 3.18、2.32、2.43 分,而最强基线 VISE 为 1.01、1.04、0.66 分;三轮训练后 2B 的增益从 3.18 升到 3.84 分。 结果来自 lmms-eval 在 GQA、OK-VQA、InfoVQA、ScienceQA、MMMU、MMBench、EmbSpatial、LogicVista、MMStar、SEEDBench 十个基准上的评测,训练数据只用无标注图像,不使用人工标注。
消融显示各组件贡献不同:去掉解析器训练影响最大,其次是事实检查器,其余组件各值 0.3 到 0.6 分。 论文逐一移除受约束解码、事实检查器、盲门控和难度带,并比较模板族难度、生成器类型、课程顺序与难度带刷新策略。 2B 上完整流程求解器准确率 62.4、解析精度 87.6;去掉解析器训练降到 58.0 与 80.8,去掉事实检查器降到 60.9;中等难度模板族最好(62.4),按族内跳数排序优于打乱(62.4 对 61.3)。
启示与展望
该框架面向照片、图表、图示与信息图四类图像域,依赖每个域预先固定的解析模式与一次性手写、不再训练的模板库;训练只需无标注图像,因此适用于缺少人工标注但图像可被结构化解析的场景。论文报告在 Qwen3-VL 的 2B、4B、8B 上均提升全部十个基准,并在 Gemma3-12B、InternVL3-8B、Llama-3.2-11B-Vision 上同样提升全部基准,说明方法不绑定单一模型族。三轮训练在同一批无标注图像上继续生成新问答对,增益仍在上升,提示可继续扩展轮次与模板族数量。
解析错误仍会直接变成错误答案,论文也指出图示箭头与图表数值是检查器最需要改进的声明类型;检查器与解析器共享同一组权重,附录用五个不同模型审计 1,417 条声明,其中 247 条为陷阱,本模型检查器拒绝了 244 条,但作者把其他检查器的否决视为警示而非真实错误率。改写环节未被检查器或盲门控覆盖,论文在 437 道题上人工核对,8B 的四个错误都发生在是/否比较中交换了两个年份。增益随模型规模缩小,从 2B 的 3.18 分降到 8B 的 2.43 分,且基准答案改变比例也从 2B 降到 8B。这些是范围与开放问题,而非对工作的否定。
