跳到主要内容
返回时间线
Hugging Face来源发表:

H公司发布Holo4通用计算机操作智能体:27B在OSWorld 2.0得61.7%,35B-A3B得30.9%,并开源全部轨迹

核心概要

H公司发布Holo4系列通用计算机操作智能体(27B稠密与35B-A3B混合专家两种规模),同一模型可通过GUI、代码、MCP与API任意接口操作桌面、网页、Android、代码沙箱与企业API,经监督学习与强化学习在含Agentic Task Factory生成任务的大量环境上训练,在OSWorld 2.0上27B得61.7%、35B-A3B得30.9%(对比Opus 5.5的81.8%),并开源公开基准上全部轨迹,同时以同一后训练配方将Nemotron 3 Nano Omni改造为Holotron4 Nano。

AI-generated editorial illustration: Holo4: powering generalist computer-use agents

深度剖析

Holo4是同一套模型权重与同一调用方式即可跨接口工作的通用计算机操作智能体,覆盖桌面、网页、Android、代码沙箱与企业API。 原文指出多数智能体模型只针对单一接口训练:GUI模型离开屏幕即失效,偏好工具调用的模型在无API的应用前受困;Holo4把点击打字、编写并运行代码、调用MCP或API工具统一在一个模型中,按任务选择合适方式。 以模型规格(27B稠密、35B-A3B MoE)、可用接口清单与跨平台运行描述为支撑,属于产品与能力层面的说明,未给出跨接口泛化的消融实验。

在长流程任务上Holo4落后于最强闭源模型但参数与成本低得多:OSWorld 2.0上27B为61.7%、35B-A3B为30.9%,Opus 5.5为81.8%。 原文称Holo4相对其Qwen基座有显著提升,并在桌面控制(OSWorld 2.0)与API使用(AutomationBench)这两类最难学术基准上以远低的任务成本与前沿模型竞争。 分数来自公开基准,但原文明确提示各点来自不同发布、不同harness与不同任务子集,成本由每次智能体运行的输入输出token估算,Holo4按H Models API价格计,因此跨点比较需谨慎。

训练数据由内部Agentic Task Factory从文档(如真实网站截图或开源软件)自动构建交互环境与可验证任务,迄今约10,000个任务,覆盖网页应用、MCP服务器与桌面环境,并包含同一状态同时经GUI与MCP暴露的混合环境。 把环境与任务生成作为可扩展的数据管线公开描述,并强调混合环境这一同时暴露两种接口的形态,区别于仅采集单一接口轨迹的做法。 给出约10,000这一规模数字与任务类型分布,属于内部管线的自述,未提供任务质量或难度分布的独立评估。

后训练配方可迁移:作为NVIDIA Nemotron Coalition成员,团队以同一配方把Nemotron 3 Nano Omni改造为Holotron4 Nano,在GUI工作流及暴露MCP、API或代码沙箱的环境中相对基座取得绝对百分点提升。 原文称这些提升表明配方迁移良好、可把通用模型变成智能体专家,且“没有任何部分是尺寸特定的”,即不依赖某一参数规模。 以相对Nemotron 3 Nano Omni的绝对百分点增益表述,但正文未列出具体数值,仅说明增益为绝对百分点改进。

启示与展望

该结果面向需要在真实业务工作流中跨接口执行长流程任务的团队,例如同时涉及桌面软件、网页应用、MCP服务器与企业API的场景;同一模型与同一调用方式意味着部署时无需按平台切换模型。对研究者而言,公开的轨迹查看器与数据集使逐步复现公开基准上的行为成为可能,而Agentic Task Factory从文档生成环境与可验证任务的思路,可用于为其他软件生态构建训练与评测任务。原文称配方不依赖尺寸,因此该后训练栈的适用对象是希望把新基座模型改造成智能体专家的团队,而非仅限某一参数规模。

原文为不完整的发布说明,缺少图表与表格,因此若干关键细节无法从文本确认:OSWorld 2.0与AutomationBench的成本-性能曲线数值、Holotron4 Nano相对Nemotron 3 Nano Omni的具体绝对百分点增益、以及各示例任务中两个模型的结果对比(仅给出调用次数、token量与代码行数)。原文亦提示各比较点来自不同发布、harness与任务子集,AutomationBench上Holo4的私有集结果待评测后报告,因此跨模型分数应视为不同条件下的参考。读者可关注后续DSpark drafter检查点、私有集评测结果,以及混合GUI与MCP环境在真实业务任务中的表现。

来源