WebFovea 在 WebRetriever 挑战赛以 57.0 分获第二名,同一模型下通过改造模型与页面之间的执行框架把隐藏集得分从 31.0 提升到 57.0
相关研究与后续进展核心概要
作者提出视觉网页智能体 WebFovea,在 WebRetriever 挑战赛 2026 的 Protocol III 端到端评测中以 57.0 分(满分 100)获得第二名;由于四次提交使用同一模型,官方隐藏集得分从 31.0 升至 57.0 被归因于执行框架的改动,并指出真实网站上的许多失败发生在解析、执行、回报、信息呈现这四个环节而非模型推理本身。
Figure 2: A parsing failure: a self-generated chat-template token typed into a data portal’s filter box (CSO PxStat; task: CPI for June 2022). The site filters on the literal string and returns no results. The model eventually diagnosed the problem in its own reasoning but kept re-emitting the token and ran out of its 40 steps.
arXiv深度剖析
论文把视觉网页智能体的每一步拆成四个必须同时成立的环节:模型回复被解析为预期动作、动作在页面上真正生效、结果被准确回报、模型看到所需信息。 以往工作多把网页智能体的成败归因于多模态大模型的推理能力,本文把关注点移到模型与页面之间的执行框架(harness),即模型与页面之间的代码。 依据来自真实网站上的失败观察:坐标空间不匹配使每次点击落在预期坐标的 3/4 处,原生下拉菜单、iframe 内和文本框中的动作静默失败,自生成的聊天模板 token 污染了 4.9% 的任务回合。
WebFovea 对上述四个环节逐一加固,并在循环外围加入护栏,使智能体保持在规则与预算之内。 论文不仅给出设计,还给出每个组件的证据(包括负面结果)、失败分析、局限与路线图,路线图包含把不同步骤路由到不同模型。 证据来自 WebRetriever 挑战赛 2026 的官方隐藏集评测,最终得分 57.0 分(满分 100),排名第二。
四次提交使用同一模型,官方隐藏集得分从 31.0 升至 57.0,说明提升来自执行框架的改动,而非更换模型。 这为“模型正确但点击错误”这一现象提供了同一模型下的对照证据,把性能提升与框架改动而非模型能力绑定。 作者说明该上升反映执行框架的改动,并提示存在真实网站上运行间的波动(run-to-run variance)。
四环节视角不依赖具体模型,尽管其中一些单独修复与模型相关。 该视角把网页智能体的可靠性问题从模型能力问题部分地转化为工程接口问题,便于在不同模型之间迁移。 作者以同一模型下框架改动带来得分变化作为支持,并明确区分了不依赖模型的整体视角与依赖模型的个别修复。
启示与展望
该结果面向在真实网站上端到端完成检索任务的视觉网页智能体,适用于需要操作网站自身界面并返回可验证答案的场景,例如 WebRetriever 基准 Protocol III 所定义的评测设置。四环节视角被作者描述为不依赖具体模型,因此可作为其他视觉网页智能体构建执行框架时的组织方式;路线图中把不同步骤路由到不同模型,指向多模型分工的后续方向。
摘要层面未给出各组件消融的完整数值,也未列出负面结果的具体内容,因此单个修复各自的贡献大小仍需阅读正文确认。作者提示真实网站存在运行间波动,隐藏集得分的上升在多大程度上可稳定复现属于开放问题。四环节视角虽被描述为不依赖模型,但部分单独修复与模型相关,其跨模型迁移效果有待验证。
