跳到主要内容
返回时间线
arXiv来源发表:

MintAct:把界面定位、跨端导航与视觉工具调用收进一个视觉智能体

核心概要

MintAct 提出 2B、4B、8B 三档视觉语言模型家族,用共享的截图观测与像素坐标空间、按域提示词切换的动作集、以及跨域均衡混合,把 UI 定位、移动端/桌面/网页多步导航和视觉工具调用统一到同一套权重中,并配套可承载数百并发实例的异步强化学习基础设施,在 OSWorld-Verified 上达到 48.9、Online-Mind2Web 上 39.1、AndroidWorld 上 67.0,与同规模单域专家模型相当或更优。

AI-generated editorial illustration: MintAct: A Unified Visual Agent for Digital Environments

深度剖析

单一模型可同时覆盖 UI 定位、移动端/桌面/网页多步导航与视觉工具调用,且不牺牲单域表现。 此前这些能力通常由各自独立构建、训练和评测的专家模型承担,MintAct 用一套权重覆盖全部能力,并在 2B、4B、8B 三个规模上验证。 论文报告在 MMBench-GUI、ScreenSpot-v2、UI-Vision、OSWorld-G、AndroidControl、AndroidWorld、OSWorld-Verified、Weblica、Online-Mind2Web、MM-ToolSandBox 等基准上与同规模专家基线对比,MintAct-8B 在 OSWorld-Verified(48.9)、Weblica(74.7)、UI-Vision(56.6)、OSWorld-G(64.5)上取得所报告的最佳成绩。

统一的关键在于三项设计:共享观测与定位空间、提示词条件化的动作集、以及显式均衡的跨域混合。 论文指出直接合并各域动作集或简单混合数据会让域之间互相干扰、侵蚀单域质量,因此改为在原始截图上以归一化像素坐标定位,并通过域专属系统提示词暴露各域动作与工具。 论文给出各域动作空间对照表与系统提示词,并说明训练中在监督微调与强化学习两个阶段都保持跨域均衡;消融显示联合 SFT 模型在移动、桌面和视觉工具调用上达到或超过单域 SFT 专家,在定位与网页上处于相近区间。

多阶段训练配方(高分辨率单步 SFT、低分辨率多步 SFT、按域 RL 专家加拒绝采样蒸馏、联合智能体 RL)每一阶段都带来可测增益。 论文用消融把各阶段贡献分开:第一阶段对定位关键,第二阶段对导航与工具调用关键,两者互补;RFT 蒸馏在保持单一权重的同时提升导航与工具调用。 论文报告仅第一阶段时 UI-Vision 达 59.3 但 OSWorld-Verified 仅 9.4、Weblica 仅 15.6;仅第二阶段时 OSWorld-Verified 回升至 41.5、Weblica 至 59.1,但 UI-Vision 降至 25.0;两阶段合并后 UI-Vision 为 56.9、OSWorld-Verified 为 42.6。

面向统一视觉智能体的异步 RL 框架可在异构环境后端上稳定训练,并显式控制跨域训练分布。 论文针对 GUI 交互慢、多模态轨迹长、混合域训练分布易漂移三个问题,设计了按域配额、配额归一化背压、双重裁剪代理目标与截断重要性权重等机制。 论文描述该框架基于 verl 与 rLLM,桌面环境在 RL 训练中可并发承载 200 个以上实例、移动端 100 个以上,消息队列容量设为 448、参数同步间隔为 5 步,并报告在噪声环境反馈与离策略漂移下保持稳定。

启示与展望

这项工作面向需要单一模型同时处理界面定位、移动端/桌面/网页导航与视觉工具调用的数字助手场景,尤其针对算力与部署成本受限的紧凑规模。论文说明联合 RL 目前只在移动与桌面两个域上执行,扩展到网页与视觉工具调用需要同时维持大量异构环境,被列为后续方向;合成环境在真实交互数据稀缺的域(如 iOSWorld)收益更明显,而当域内真实数据可用时,真实域内 RL 的增益更大。论文还指出,视觉工具调用目前基本作为独立能力处理,尚未实现像素级导航与动态工具调用之间的自动切换。

论文的联合 RL 只覆盖移动与桌面,网页与视觉工具调用的联合训练效果仍是开放问题;长时程交互中上下文随截图不断追加而快速增长,更精细的上下文管理尚未纳入;动态工具注册表下的轨迹分段只提供较粗的信用分配,论文将其视为对端到端交互的近似。此外,本次读取的是论文全文文本,表格中的部分数值在文本中以占位形式出现,具体逐项分数需以原文表格为准。

来源