AutoGUIWorld 用图像生成器合成 79,266 条 GUI 轨迹,微调后 OSWorld 从 33.0% 升至 40.8%、ScienceBoard 从 14.0% 升至 32.2%
核心概要
AutoGUIWorld 提出一个数据生成框架,把图像生成器的视觉先验与规划器的任务知识结合,在不部署或运行对应软件环境的情况下合成 GUI 交互轨迹:它从操作系统上下文、视觉外观与界面状态的结构化规格中采样初始界面,据此生成任务,由规划器给出原子动作及其预期视觉后果,再由图像生成器迭代编辑当前截图产生后续观测,经动作定位与转移级质量过滤后得到跨 Ubuntu、Windows、macOS 与 Chrome 的 79,266 条带空间标注的步级训练样本,用其微调 Qwen3.5-35B-A3B 后 OSWorld 平均任务分从 33.0% 提升到 40.8%,ScienceBoard 任务成功率从 14.0% 提升到 32.2%。
深度剖析
该工作把 GUI 轨迹生成拆成规划层与视觉世界模型层:Meta Planner 依据任务与固定种子上下文生成有序原子动作序列及预期视觉变化,Voyager 结合当前截图、计划动作与 rollout 上下文扩展出渲染提示,Image2 据此编辑当前截图生成下一视觉状态,从而在不实例化真实系统状态的前提下产出时间连贯的截图—动作—截图轨迹。 此前的轨迹获取依赖人类演示、从教程与录屏中抽取,或在可执行环境中自动探索,覆盖范围受限于可访问的可执行环境或既有记录;AutoGUIWorld 用预训练图像生成先验替代环境执行,把覆盖范围从“已部署的软件”扩展到“可结构化描述的软件”。 论文给出完整的形式化分解(任务与初始视觉状态采样、规划层、视觉世界模型层)与闭环 rollout 流程说明,并公开了各阶段提示模板与动作空间定义。
该工作构建了 79,266 条带空间标注与质量过滤的步级训练样本,覆盖 Chrome 35,209、Ubuntu 24,250、Windows 14,778、macOS 5,029 条,并分析了其覆盖度与转移缺陷。 相对 ScaleCUA 等真实语料,合成数据在全部十二个“域—阈值”比较中提升了检测到的 UI 覆盖度,相对增益为 Ubuntu 63–77%、Windows 51–75%、Web 49–71%、macOS 10–13%;同时 Qwen 嵌入的合成—ScaleCUA MMD 落在 0.59 到 1.24 之间,与独立采集的真实数据集之间的差异处于同一经验尺度。 覆盖度用 OmniParser-v2.0 检测框并集栅格化统计,视觉对齐用 Qwen3.5-9B 合并视觉 token 的 MMD 与 C2ST 探针,并报告了分组自助法置信区间;180 份检测叠加图的人工抽查未发现系统性地把生成纹理标为 UI 元素。
在真实环境评测中,用 AutoGUIWorld 轨迹微调 Qwen3.5-35B-A3B 得到的 AGW-35B 在四个交互基准上全部提升,四项等权平均分从 23.6% 升至 36.5%,其中 macOSWorld 与 ScienceBoard 增幅最大,分别为 16.9 与 18.2 个百分点。 这提供了“合成轨迹可迁移到真实软件环境”的直接证据:OSWorld 从 33.0% 到 40.8%,WAA 从 19.4% 到 27.9%,macOSWorld 成功率从 28.1% 到 45.0%,ScienceBoard 成功率从 14.0% 到 32.2%;在 ScreenSpot-Pro 上整体定位准确率从 31.7% 升至 57.1%。 评测使用固定任务集与统一评测框架,OSWorld 361 题、WAA 154 题、macOSWorld 231 题、ScienceBoard 143 题、ScreenSpot-Pro 1,581 题,并报告了六个检查点的训练曲线;与 AgentNet 真实演示训练运行的对比中,AGW-35B 在四个基准上均超过其最佳评估检查点。
该工作量化了图像生成作为世界模型的保真度边界:在 42,526 个可评估桌面转移中,VLM 审计标记出 1,293 个动作—图像不一致(3.04%);在剔除无效动作、目标缺失或定位错误后,39,351 个转移中仍有 818 个不一致(2.08%)。 它把“视觉上合理”与“忠实实现动作”区分开来,并给出按动作类型分解的残余错误分布:拖拽 7.58%、滚动 7.09%、文本输入 6.35%、热键 3.23%、按键 2.16%、点击 0.67%,指出精确内容保持是视觉转移合成的独立难点。 审计采用结构化五维检查(目标存在、框命中、框紧致、动作有效、观测转移一致),对 3,390 个目标框重新定位后复检,并报告了 Ubuntu、Windows、macOS 分域结果与代表性失败模式。
启示与展望
这项工作面向需要大规模 GUI 交互轨迹来训练智能体的研究者与工程团队,适用场景是在不部署或运行对应软件环境的前提下扩充训练数据覆盖,尤其是难以安装配置的专业软件与工作流。它使后续工作可以在四个桌面与浏览器域上复用结构化采样空间、种子条件任务生成、规划器引导 rollout、动作定位与质量过滤这条流水线,并把生成的轨迹转换为监督微调、轨迹回放或强化学习数据。论文也指出,面向特定软件或工作流的领域特化训练有望得到垂直的 GUI 世界模型,改善长程一致性并支持该领域内的进一步数据生成。
图像生成器在长轨迹与复杂交互下可能累积误差,产生幻觉界面状态或动作结果;论文报告的残余不一致集中在文本输入、拖拽、滚动与键盘交互,包括命令替换、编造文档内容、过早格式化、动作效果缺失与持久内容被意外修改。当前发布的轨迹中前置条件与阻塞字段全为零,渲染的终止状态几乎总是成功,因此失败路径的覆盖情况仍待观察。轨迹结构统计(如 Ubuntu 与 Windows 平均 11.9 与 11.4 步、macOS 动作类型熵 0.92)描述的是合成语料,匹配的真实轨迹元数据在该分析中不可得。与 AgentNet 运行的对比使用不同的推理设置,训练步轴也未对轮次、token 或算力做归一化。此外,本次加载的是论文全文文本,图表与附录中的部分可视化内容以文字描述形式呈现,若需核对具体图形细节仍需查阅原文。
