ReLaViS 用单轮循环隐式视觉搜索把 ScreenSpot-Pro 定位准确率提升 3.1 个百分点至 56.3%
相关研究与后续进展核心概要
该工作提出 ReLaViS,把 GUI 定位表述为单次模型交互内的循环隐式视觉搜索:每步由空间搜索头用隐藏状态查询截图的视觉 token 生成空间搜索分布,再据此聚合视觉 token 得到隐式视觉证据并回灌为下一步输入嵌入,同时用扁平元素标注构造 GUI 感知的由粗到细轨迹进行监督;基于 Qwen2.5-VL-7B,它在五个基准上均优于匹配的单步基线,ScreenSpot-Pro 准确率从 53.2% 提升到 56.3%,推理 FLOPs 仅增加 3.5%。
Figure 1: Conceptual comparison of grounding paradigms. ReLaViS performs GUI-aware coarse-to-fine visual search by updating explicit spatial search states within a single model interaction.
arXiv深度剖析
把 GUI 定位重新表述为模型内部的循环隐式视觉搜索,搜索状态是与视觉 token 网格对齐的显式空间分布,并在单次交互内完成多步搜索,无需外部工具或多轮图像重编码。 此前多步方法要么用与视觉空间不对齐的文本思维链,要么依赖缩放、裁剪等外部视觉工具并付出多轮交互与重编码代价;已有隐式视觉推理也未显式跟踪视觉 token 网格上的搜索焦点。 方法层面给出空间搜索头、隐式视觉证据聚合与确定性坐标读出的完整定义;在五个基准上与匹配单步基线比较,ScreenSpot-Pro 上 53.2% 对 56.3%,推理 FLOPs 仅增 3.5%。
用扁平 GUI 元素标注构造由粗到细的搜索轨迹,为多步搜索提供 GUI 感知的归纳偏置,无需稀缺的 UI 树标注。 层级丰富的 GUI 语料多集中于移动或网页平台,桌面定位数据并不总是把 UI 树与指令和目标元素对齐;该工作用递归划分候选元素集并按候选数量缩减挑选关键步,从扁平标注近似 GUI 层级。 在 105,000 个训练与验证样本上统计轨迹,默认四步设置下平均候选集规模从 74.25 收缩到 28.01、10.11 和 1.00,89.68% 的样本恰好提供两个中间关键步;在 1,125 张带 UI 树标注的 macOS 截图上,其集合 IoU 比几何缩放高 12.7 和 16.8 个百分点。
循环搜索带来的增益主要出现在小目标场景,且后续搜索步骤在功能上依赖前序空间搜索状态。 单步定位在高分辨率屏幕、小目标和密集布局上表现受限;该工作把增益与目标尺寸联系起来,并通过干预前序搜索分布检验其因果作用。 按相对目标面积分箱后,最大目标箱与单步基线相当,较小目标箱增益更大,五个基准的基准内分析呈类似倾向;在步骤 1:3 注入目标对齐高斯使准确率提高 2.0–13.1 个百分点,注入目标反向高斯则降低 4.7–14.2 个百分点,第三步最敏感。
三阶段训练与候选级覆盖监督是循环搜索生效的关键设计,且增益在更小模型规模上依然存在。 直接增加循环步数或在每步重复目标元素监督并不能带来同等提升,说明收益来自 GUI 感知的由粗到细监督与训练—推理适配,而非单纯增加计算。 四步仅末步监督为 54.0%、每步重复目标监督为 53.9%,完整 ReLaViS 为 56.3%;去掉第三阶段降至 53.0%,去掉第二阶段为 54.7%,去掉第一阶段为 54.9%;在 Qwen2.5-VL-3B 上平均准确率从 58.1% 提升到 61.2%。
启示与展望
该结果面向以截图和指令为输入、输出点击坐标的 GUI 定位设置,适用于桌面、网页与移动界面,并在 Qwen2.5-VL-7B 与 3B 两个规模上得到验证。它使多步视觉搜索可以在单次模型交互内完成,不需要元素标注、UI 树、缩放或裁剪工具,也不需要额外交互轮次,因此适合对延迟与推理成本敏感的 GUI 智能体部署;与外部缩放结合时,五基准平均可进一步提升到 70.0%。
搜索步数并非越多越好,四步在当前设置下最优,更多步数的行为仍是开放问题;增益在不同基准间差异明显,ScreenSpot-v2 上仅 0.3 个百分点,且与目标尺寸相关。失败案例显示最终点击仍可能受视觉 token 网格分辨率、指令与标注歧义以及抽象视觉语义区分能力的影响。当前工作聚焦点击动作,向拖拽等其它动作与通用视觉搜索任务的扩展尚未验证。此外,正文中的公式、表格与图以占位形式呈现,具体数值细节需查阅原文附录。
