CUA-SWE 用 105 个可执行任务测出:给智能体看运行界面后,GPT-6-Astra 四域均值从 11.3% 升到 59.9%
核心概要
作者提出 CUA-SWE——一个覆盖 Web、Game、DevOps、Mobile 四个软件工程领域、共 105 个任务的基准、交互式开发环境与评测流水线,让智能体在同一任务中改代码、跑命令、操作运行中的软件并查看截图,用任务专属的确定性测试判定结果;在代码-only 与混合 CUA 两种条件下对比前沿模型,GPT-6-Astra 取得最高四域均值 59.9%,且每个前沿模型在混合 CUA 下聚合成功率都更高,增益集中在必须从应用材料(图纸、服务契约、图形参考卡)中恢复需求的任务上。
深度剖析
CUA-SWE 把「改代码」和「用软件」放进同一个开发回合:智能体可读改源码、执行构建与脚本、通过鼠标键盘与截图操作运行中的应用,任务由独立于轨迹的确定性验证器判定,检查请求功能、既有功能回归与允许改动三类条件。 此前的编码基准(如 SWE-bench 系列)与计算机使用基准(如 OSWorld、WebArena)大多分开评估改代码或操作界面,视觉软件基准又集中在单一开发领域;这里把源码级执行与图形交互统一到同一任务,并给出可执行正确性判据。 论文给出问题形式化(有限时域 POMDP)、动作空间定义、验证器构造流程,以及 gold 修复与负例修复的双向验证;任务经 LLM 辅助撰写后由人工复核并通过可执行校验。
基准含 105 个任务:36 个 Web、29 个 Game、20 个 DevOps、20 个 Mobile,并按规格来源标注为 source-specified(S)与 application-material-dependent(M),M 类共 63 个任务(58 个依赖运行时提供的材料,5 个依赖随项目打包的图形参考卡)。 把「需求信息在哪里」作为可标注的任务属性,使基准能区分「实现与调试」和「从运行界面恢复规格」,而不只是给任务贴难度标签。 论文给出各领域任务清单与逐任务标注依据,并说明 2048、Fabric、Flappy Bird 等虽含运行时装置仍归为 S 的理由。
在单次尝试的四域对比中,GPT-6-Astra 取得最高均值 59.9%,比 GPT-5.6-Sol 高 17.7 个百分点,并在每个领域都取得最高观测混合成功率(Web 66.7%、Game 37.9%、DevOps 80.0%、Mobile 55.0%);所有参与四域对比的前沿模型在混合 CUA 下聚合成功率都高于代码-only,GPT-6-Astra 提升 48.6 个百分点。 把「视觉反馈是否真的帮到软件工程」从直觉变成按领域、按信息需求分层的配对测量,并显示增益并非均匀分布。 同一批任务、同一套受保护测试在两种条件下配对比较;论文报告 32 个模型–领域队列、840 个配对模型–任务观测,并对 Web 与 Game 做 20,000 次配对自助重采样。
增益集中在 M 类任务:八个前沿模型在 M 类上的平均混合优势为 Web 42.0、Game 23.6、DevOps 48.1、Mobile 38.8 个百分点,而 S 类任务上 Web 与 Game 的平均差异为 0.0 个百分点;轨迹分析显示,最终编辑后对改动后应用做 GUI 复验与更高成功率相关(如 Web 45.8% 对 5.7%,Mobile 83.7% 对 10.6%)。 把「界面访问带来什么」拆成两类作用:暴露决定实现的材料,以及让智能体在改动后重新操作应用、检查改动的后果。 分层比较使用完全相同的任务集合;轨迹分析基于 2,040 次评测尝试的交互计数与 214 条轨迹的详细标注,作者明确说明这些是描述性关联而非显著性检验。
启示与展望
这套基准面向的是本地托管、可复现启动的应用与游戏,任务限定在 Web、Game、DevOps、Mobile 四个领域,评测在固定的动作预算与时限内进行,因此结论适用于「在给定界面与预算下,智能体能否把视觉证据转成通过验证的软件改动」这一问题。它直接服务于两类读者:需要判断混合 CUA 智能体在真实开发流程中可用性的研究者与工程团队,以及希望用可执行验证器构造训练信号的后训练研究者。论文还给出可复用的监督路径:用通过验证的参考回放构造动作前缀数据,对 Qwen3.8-27B 做 SFT 后,原生验证器通过率从 11.1% 升到 33.3%,并描述了以 GRPO 为基础的 RLVR 目标与并行 rollout 接口。
需要留意的是,论文自述 SFT 结果只是「早期正向迹象」,是否构成可验证的学习信号、以及可扩展的 RLVR 训练仍属后续工作,涉及并行 rollout 采集、长多模态轨迹上的稳定优化与跨代码编辑、观察、交互的信用分配。轨迹标注方面,作者报告部分阶段标签(如错误解释、误诊)的双标注一致性较低,因此这些标签被作为探索性描述;最终编辑后 GUI 复验与成功率的关联也是描述性估计,任务难度、模型与轨迹校验成分都可能参与其中。此外,重复尝试显示覆盖率会随尝试次数上升(如 Game 上 GPT-6-Astra 的 pass@1 37.9%、pass@3 62.1%),而三次全中的比例只有 34.5%,说明单次结果与稳定能力需要分开看;Core Ball 与 Mobile 排程族在单次评测中无人完成,也提示耦合状态与密集依赖仍是开放难点。本总结基于论文全文与其附录,未独立复现实验。
