CoreWeave 将 NVIDIA Vera Rubin NVL72 投入生产,Cognition 实测 SWE-2 推理总 token 吞吐量最高提升 4.8 倍
核心概要
CoreWeave 在 Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,首个客户 Cognition 用 FrontierCode 任务子集构建真实软件工程负载,早期测试显示 SWE-2 推理总 token 吞吐量较 GB200 NVL72 最高提升 4.8 倍;同时 CoreWeave 将提供面向 AI 智能体的 NVIDIA Vera CPU,并推出整合 Weights & Biases、OpenPipe 后训练能力与 marimo 的 CoreWeave Forge 环境。
深度剖析
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网在 CoreWeave Cloud 上可用,并称自己是首批把该平台交付到客户手中的云服务商之一。 此前该平台尚未在云上以生产形态交付;文中称 CoreWeave 在收到首批 Vera Rubin NVL72 生产机架后数天内就为 Cognition 搭起生产集群。 依据是公告与部署叙述,以及 NVIDIA 超大规模与高性能计算副总裁 Ian Buck 的引述;属于厂商发布信息,未给出第三方复现。
Cognition 在真实软件工程负载上对比 Vera Rubin NVL72 与 GB200 NVL72,早期测试显示 SWE-2 推理总 token 吞吐量最高提升 4.8 倍。 该对比使用从 FrontierCode 采样的任务子集并部署 AI 智能体求解,而非合成基准;文中称 Cognition 九个月内扩展到数千块 GPU。 文中明确为“早期测试”,只给出相对倍数,未报告绝对吞吐量、任务数量或统计不确定性。
CoreWeave 将提供 NVIDIA Vera CPU,单机架 128 颗 CPU、11,264 核,可支持超过 11,000 个单核并发隔离环境;测试中智能体沙箱启动时间提升 3 倍以上,Terminal-Bench 上所有通过任务整体性能提升 1.7 倍。 把面向智能体的 CPU 与 CoreWeave Sandboxes 的硬件隔离环境结合,使后训练所需的数千个隔离环境可与训练作业并行运行。 数据来自 CoreWeave 自测,文中未说明测试规模、重复次数或基线配置。
CoreWeave Forge 把 Weights & Biases、OpenPipe 的后训练能力与开源 marimo 笔记本整合为一个跨模型、框架与云的持续改进环境,其中 Agent Lens 将故障检测提升 20%、以一半成本修复问题,Serverless RL 训练速度提升 1.4 倍、成本降低 40%。 此前生产行为到下一轮训练的闭环分散在不同厂商工具中,每次交接都会丢失信号;Forge 试图把这一循环收进单一环境。 均为厂商公布的对比数字,未提供对照设置细节;Canva、Capital One、MasterClass 被列为早期使用方。
启示与展望
这份材料面向正在选型 AI 基础设施的团队:需要大规模智能体推理、后训练与评估闭环的 AI 实验室、AI 原生公司和大型企业,可以在 CoreWeave Cloud 上通过 CoreWeave Kubernetes Service、SUNK、Mission Control、Sandboxes 与 Inference 使用这些能力。文中给出的适用场景包括软件工程智能体、强化学习 rollout 与模型评估,以及 Ennoble Care 这类以临床文档、决策支持和后台自动化为目标的医疗推理部署。
文中所有性能数字都来自厂商或客户自测,且明确标注为“早期测试”,因此 4.8 倍吞吐、3 倍以上沙箱启动、1.7 倍 Terminal-Bench 与 1.4 倍训练加速在多大负载、何种基线配置下成立,仍需更多细节才能判断。Cognition 的对比只给出相对倍数,未报告任务数量、绝对吞吐或方差;Agent Lens 的 20% 故障检测提升与一半成本也缺少对照说明。此外,本文是产品与平台发布叙述,未提供可复现的基准方法或第三方评测,读者若要据此做采购或架构决策,宜等待更完整的基准披露。
