跳到主要内容
返回时间线
arXiv来源发表:

8B 多模态验证器 SciGen-Verifier 在科学图像验证基准上以 86.28% 判断准确率超过 Qwen3.8-Max,并可作为在线批评者迭代纠错

核心概要

该工作构建了面向科学图像生成可解释验证的基准 SciGen-Verify(1,350 个样本,覆盖指令遵循 406、多学科推理 287、世界知识 657,采用二元判断、解释、编辑指令三层级联协议),并提出基于 Qwen3-VL-8B-Instruct 的 SciGen-Verifier,经冷启动监督微调(48,311 条实例)与课程式两阶段强化学习(先 rubric 引导的过程奖励、后结果奖励)训练,在基准上取得 86.28% 总体判断准确率、81.79% 解释准确率与 57.42% 编辑指令准确率,并可作为在线批评者用于迭代图像修正。

AI-generated editorial illustration: SciGen-Verifier: A Multimodal Reasoner for Explainable Verification in Scientific Image Generation

深度剖析

论文提出 SciGen-Verify,作者称其为首个面向科学图像生成可解释验证的基准,覆盖指令遵循、多学科推理与世界知识三个领域,并采用二元判断、解释、编辑指令的三层级联协议。 此前的验证基准与奖励模型主要面向自然图像,关注通用图文对齐与人类审美偏好;已有的科学图像生成基准虽引入细粒度评分标准,但只是静态离线测试平台,缺少能主动给出可解释、可执行纠错反馈的专用验证器。 基准共 1,350 个样本(指令遵循 406、多学科推理 287、世界知识 657),经 AI 辅助标注加 10 位领域专家(数学、物理、化学、生物、地理各两名研究生)双人独立评审,样本仅在两位专家均认可时保留;负样本通过视觉扰动与文本扰动两类受控策略构造,并经过滤去除严重模糊、文字不可读或明显生成失败的候选图。

论文提出 SciGen-Verifier-8B,以 Qwen3-VL-8B-Instruct 为基座,经冷启动监督微调后接课程式两阶段强化学习:第一阶段用 rubric 引导的过程奖励强化科学推理探索,第二阶段用结果奖励对齐判断、解释与编辑指令。 作者观察到监督微调的失败主要源于证据探索不完整而非推理不连贯,因此先以过程级奖励扩大推理覆盖,再引入结果级奖励,避免过早使用结果奖励导致训练不稳定。 监督微调语料为 48,311 条实例(指令遵循 19,678、多学科推理 20,367、世界知识 8,266),采用拒绝采样保留判断与真值一致且解释经模型校验的样本;强化学习使用 GRPO,第一阶段从部分成功的 rollout 中保留 15K 查询,第二阶段使用 685 条带答案、解释与编辑指令完整标注的样本;训练与基准在源样本级别切分,同一源问题及其全部扰动变体只属于其中一个集合。

在 SciGen-Verify 上,SciGen-Verifier-8B 取得 86.28% 总体判断准确率、81.79% 解释准确率与 57.42% 编辑指令准确率,超过最强基线 Qwen3.8-Max(86.03%、84.46%、64.75% 中的判断与解释项)以及 Gemini-3.5-Flash 与 GPT-6-Astra 等更大规模专有模型。 作者称该模型以 8B 轻量骨干在三个领域均表现稳健,其中世界知识领域达到 94.21% 判断准确率、91.53% 解释准确率与 65.48% 编辑指令准确率,分别高出 Qwen3.8-Max 6.45、4.41 与 5.67 个百分点;而面向通用图像验证训练的 OmniVerifier-7B 在该基准上表现很差,说明科学验证超出通用图文对齐范畴。 对比覆盖 15 个领先多模态模型,全部在相同输入输出协议与相同评判模型下评测;解释与编辑指令由 GLM-4.7 与 Doubao-Seed-2.0-Lite 担任模型评判,在 300 个人工标注实例上与人类专家的一致率分别为 95.3% 与 94.7%,接近人类之间 98.3% 的上限,且换用 GPT-5-mini 评判后模型排序保持不变。

消融显示显式思维链与课程式两阶段强化学习缺一不可,且 SciGen-Verifier 可作为在线批评者驱动迭代式测试时扩展,逐步修正科学图像生成错误。 无思维链的直接预测虽判断准确率可达 81.0%,但解释与编辑指令准确率骤降至 65.9% 与 36.4%,且在此范式上施加强化学习收益甚微;跳过过程级奖励直接使用结果奖励会把推理准确率过早限制在 84.9%、编辑指令准确率限制在 51.2%。 在测试时扩展应用中,以 Wan2.6-t2i 生成初始图像、由验证器判断并在需要时触发重生成或局部编辑,最多迭代 10 步,宽松分数从初始 58.7 提升至 63.5;作为对照,Gemini-3.5-Flash 与 Qwen3.8-Max 十步后分别为 64.9 与 64.4,仅高出 1.4 与 0.9 分,Seed-2.0-Pro 轨迹更波动、最终为 62.6。

启示与展望

该结果面向科学图像生成与编辑的验证场景,适用于需要判断图像是否满足多步科学约束、并给出可执行纠错指令的教育与生成系统;基准覆盖指令遵循、多学科推理与世界知识三个领域,模型以 Qwen3-VL-8B-Instruct 为基座、在源样本级别与基准切分的 48,311 条语料上训练,因此其定位是这一验证任务上的专用验证器与在线批评者,而非通用图像质量评估器。

编辑指令准确率在所有模型上都明显低于判断与解释准确率,作者也指出合成可执行的纠错编辑仍是主要瓶颈,这一环节的进一步提升空间值得持续观察;此外,基准与训练语料共享上游来源,虽在源样本级别切分,跨来源的泛化表现仍是开放问题;测试时扩展的宽松分数与基准的三项层级指标不可直接比较,其迭代轨迹也并非每一步单调上升。

来源