EviRover 让 4B 模型学会“多看一眼”:在 EviLens 上比基座平均提升 30 分,BrowseComp-VL 提升 15 分
核心概要
该工作提出“证据不足下的感知”设定,把定位、分割、计数等感知任务重构为主动搜寻证据的智能体过程,构建两条数据生成流程得到 EviRover-SFT-5K 与 EviRover-RL-12K,并发布含 688 个实例、覆盖五类感知任务的人工核验基准 EviLens;经监督微调加智能体强化学习训练的 4B 模型 EviRover 在 EviLens 上比其 Qwen3-VL-4B-Instruct 基座平均提升 30 分,接近先进闭源模型水平,并在 WebEyes、ReasonSeg、RefCOCOg、MMMU、MMMU-Pro、MathVerse 以及 BrowseComp-VL(提升 15 分)上取得迁移收益。
深度剖析
论文识别出一类被忽视的感知情形:查询所需证据不在单次注视可得的范围内,并称之为“证据不足下的感知”(perception under insufficient evidence)。 以往定位、分割、计数普遍被表述为图像—查询对的一次性预测,默认图像内容与模型参数化知识足以解答;该工作把感知本身设为证据搜寻的目标,而非把搜寻当作回答文本问题的辅助手段。 论文以论证与任务设定方式提出该问题,并指出既有提示式流程依赖人工设计的推理时策略、已有搜索型分割智能体仅限分割且假定缺失证据总是外部知识,从而说明该设定此前未被系统覆盖。
为支撑该设定,作者设计两条数据生成流程,产出 EviRover-SFT-5K 与 EviRover-RL-12K 训练集,并构建人工核验基准 EviLens。 一条流程针对“证据在图像内但一眼不可辨”,收集目标常占图像面积远低于 0.1% 的高分辨率图像以及 I-spy、找不同等需多步视觉探索的场景;另一条针对“证据在图像之外”,从真实合影核验身份,或以单张参考图经 GPT-Image-2 合成合影并用 Seed-2.0-Pro 过滤,再通过迭代实体替换把查询改写为多跳形式。 EviLens 含 688 个实例,覆盖定位 140、识别 182、找不同 15、分割 195、计数 156,找不同部分共标注 79 处差异,且每个实例均经人工核验;训练数据规模由论文给出的 5K 与 12K 命名与描述支撑。
EviRover 是作者所称首个显式训练来通过交互解决感知查询的感知智能体,采用监督微调后接智能体强化学习的两阶段训练。 模型在每一步自行判断是否需要更多证据以及哪种动作能提供证据,再输出位置、边界或计数;强化学习阶段使用 EMA-GRPO 以跨异构任务归一化奖励,并采用序列平均—词元平均的损失归约以避免长轨迹主导策略更新。 方法描述给出十种工具(文本搜索、文搜图、图搜图、网页浏览、裁剪、验证、局部验证、SAM3 掩码、左右对比、Python 解释器),训练在单节点 8 张 NVIDIA A800-80GB 上以 FSDP 完成,评测限制每条轨迹最多 35 次工具调用。
实验显示 EviRover 在 EviLens 上比基座平均提升 30 分,并在多个外部基准上取得迁移收益。 4B 模型在定位与识别上取得所评测模型中的最佳结果,定位 IoU 为 0.444 对 Gemini-3.5-Flash 的 0.373;在 WebEyes 上接地提升 14.4 IoU、分割提升 24.7 gIoU;在 ReasonSeg、RefCOCOg、MMMU、MMMU-Pro、MathVerse 上均优于基座,BrowseComp-VL 准确率由 9.5 升至 24.8。 结果以表格形式给出,覆盖闭源模型、开源分割/接地模型与开源通用模型多类对照;作者同时报告 EviLens 对现有模型族普遍困难,分割专家最高仅 0.343 gIoU,接地专家在定位上接近零 IoU。
启示与展望
该结果面向需要在单次注视之外获取证据的感知查询,适用于定位、识别、找不同、分割与计数五类任务,并已在 EviLens、WebEyes、ReasonSeg、RefCOCOg、MMMU、MMMU-Pro、MathVerse 与 BrowseComp-VL 上评测。对使用者而言,这意味着可以把“何时搜索、搜索什么”作为可训练能力而非推理时手工提示,并可在开源代码、模型与数据基础上继续扩展;对下游应用,论文指出准确感知支撑具身操作与图像编辑等场景。
EviLens 的找不同类别仅 15 个实例、共 79 处标注差异,计数与找不同上的结论所依据的样本相对有限;合成合影中真实人物仅保留一名可核验身份,身份覆盖程度在不同来源间不一致;训练与评测均限制每条轨迹最多 35 次工具调用,更长视野下的行为尚待观察;此外,本次读取为全文,但表格与附录中的部分数值细节仍以论文原文为准。
