跳到主要内容
返回时间线
arXiv来源发表:

HybridCUA 让 9B 智能体在 OSWorld 上用 GUI+CLI 混合操作拿到 53.6%,比基座高 14.8 个百分点

核心概要

该工作构建了包含 5,000 条 GUI-only、CLI-only 与交错 GUI–CLI 轨迹以及 3,000 个带可执行验证器 RLVR 任务的数据管线 HybridCUA-8K,并提出先监督微调、再用带 CLI 感知奖励的在线强化学习的两阶段训练框架,训练出的 HybridCUA-9B 在 OSWorld 上达到 53.6% 准确率(较基座 Qwen3.5-9B 提升 14.8 个百分点、平均步数从 31.6 降至 14.0),在 WindowsAgentArena 上达到 36.0%(提升 4.0 个百分点)。

AI-generated editorial illustration: HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents

深度剖析

论文指出,直接把 shell 交给现有智能体反而有害:暴露 CLI 后四个代表性智能体在 OSWorld 上下降 2.5 至 11.5 个百分点,Qwen3.5-27B 与 EvoCUA-32B 分别只有 15.0% 和 0.15% 的步骤走 CLI。 此前工作要么只用 GUI,要么依赖按应用定制的 API/工具;本文把“何时用 CLI、如何用 CLI”本身当作要学习的能力,而不是假设模型天然会用。 该结论来自对四个已有智能体在 OSWorld 上的对比测量,并给出 CLI 步骤占比这一直接指标;属于诊断性证据,说明瓶颈在接口选择而非接口可用性。

作者构建 HybridCUA-8K:5,023 条监督轨迹(GUI-only 由 UI-MOPD 轨迹转写为 PyAutoGUI 调用,CLI-only 由 Qwen3.8-27B 在 Claude Code 执行框架下采样,交错轨迹来自自由切换与 GUI→CLI 重写并只保留成功重放),外加 3,000 个带可执行验证器的 RLVR 任务,每个任务用 16 次 rollout 在三种接口模式下排序并标注 CLI 是否具有明确执行优势。 GUI、shell、代码语料此前彼此割裂,CUA 数据集几乎只有 GUI 动作;该管线让接口选择与命令执行都落在 GUI 上下文里,并把“CLI 是否有优势”变成显式标签。 数据规模、来源、平均 10.4 步(中位数 7、90 分位 22、最大 50)以及标注流程(16 次 rollout、5 个百分点内按成功 rollout 中位步数打破平局)在正文与附录中均有说明。

两阶段训练把接口选择变成显式信号:SFT 在 5,023 条轨迹上做下一 token 预测,随后在实时双接口环境中用 GRPO 做 RLVR,轨迹级奖励 R_CLI = I[Success]·I[b(τ)=b*] 教“何时用”,步级奖励 r_exec 对 shell 执行失败给 −1 教“如何用”。 此前混合接口工作要么用 VLM 粗粒度打分,要么只监督任务结果,接口选择始终隐含在模仿中;这里把路由与执行可靠性分别作为奖励项。 消融显示去掉 R_CLI 后准确率损失不大但效率提升停滞(CLI 占比 58.9% 而非 64.0%,轨迹缩短 18.2% 而非 29.3%),去掉 r_exec 后准确率与步数基本不变但执行错误率回升到 16.5%,而完整模型稳定在 11.5%。

HybridCUA-9B 在 OSWorld 上达到 53.6% 准确率、平均 14.0 步,优于同规模模型,并超过 AutoGLM-OS-9B 4.7 个百分点、ToolCUA-8B 6.8 个百分点、参数量四倍的 UltraCUA-32B 9.9 个百分点;在 OSWorld-MCP 上 47.1%,在 WindowsAgentArena 上 36.0%。 GUI–API 路线需要逐应用构建接口,而 shell 无需按应用定制;同时该模型在 Windows 上发出 PowerShell 命令,尽管只在 Linux shell 上训练。 主结果基于 OSWorld 全部 361 个任务、每题最多 50 步,报告的是平均评估器得分;迁移结果分别在 OSWorld-MCP 的 361 个任务与 WindowsAgentArena 的 154 个任务上单独报告,未合并为单一总分。

启示与展望

该结果面向具备可用且稳定命令行接口的桌面应用与操作系统环境,训练数据主要覆盖 OSWorld 所包含的应用(11 个领域,LibreOffice 三件套与多应用占多数),评估在沙箱虚拟机中进行、每回合重置且不接触真实账户或凭据。对读者而言,这提供了一条不依赖逐应用 API 的混合接口路线:GUI 负责视觉交互与空间调整,shell 负责文件与系统级操作,并可在 MCP 环境与 Windows 上沿用。作者也说明将发布轨迹、RLVR 任务、数据生成与训练管线以及 HybridCUA-9B 模型,便于在自有应用上复现与扩展。

仍待观察的是:收益依赖命令行接口的可用性与稳定性,缺少可用 CLI、shell 受限或命令语义随操作系统变化的应用可能需要不同的路由行为;数据构建目前集中在 OSWorld 覆盖的应用,对专用领域应用与更广的分布外环境代表性有限;OSWorld-MCP 与 OSWorld 共用同一任务集,因此它衡量的是环境变化而非全新任务;报告的是平均评估器得分,部分验证器返回分数而非二值,与严格全对全成功率不可直接比较;每个数字来自单次评估运行,且未用验证集做模型选择。此外,shell 访问会放大单步动作的影响,真实部署中的行为与安全超出本研究范围,需要额外评估、防护与人工监督。

来源