NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中取得领先性能
核心概要
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7 倍、在 DeepSeek-R1 上最高达 2.5 倍,同时 GB300 NVL72 以 288 GPU 四机架实现 99% 扩展效率,软件优化较 v6.0 提升最高 1.6 倍。
深度剖析
Vera Rubin NVL72 首次 MLPerf Inference 预览提交即在两个高难度基准上领先:Qwen3-VL 上吞吐量最高为 GB300 NVL72 的 3.7 倍(覆盖 offline、server、interactive 场景,使用 vLLM 与 NVIDIA Dynamo),DeepSeek-R1 上最高为 2.5 倍(使用 TensorRT-LLM)。 这是 Vera Rubin NVL72 的首次 MLPerf Inference 预览提交,此前该平台没有对应的公开基准成绩,因此给出了新平台相对上一代 GB300 NVL72 的首个可比吞吐量参照。 来自 MLPerf Inference v6.1 Closed Division 提交(条目 6.1-0106 与 6.1-0074),结果于 2026 年 9 月 16 日从 mlcommons.org 获取;文中将其定位为“预览结果”,并说明性能将随持续软件优化进一步提升。
GB300 NVL72 在 DeepSeek-R1 上从单机架 72 GPU 扩展到四机架 288 GPU,在 offline 场景实现 99% 扩展效率,吞吐量几乎与新增硬件成比例增长。 把“加 GPU 是否等比例换来吞吐量”这一基础设施生产率问题,用同一基准上的单机架到四机架对比给出了量化答案,而非仅报告单点峰值。 MLPerf Inference v6.1 Closed Division 提交(条目 6.1-0073 与 6.1-0074);文中同时说明该效率依赖机架内高带宽低延迟互连、机架间高带宽网络与跨节点请求编排。
软件优化带来持续增益:v6.1 中 GB300 NVL72 在 Qwen3-VL 上较 v6.0 提升最高 1.6 倍,来源包括更低的 KV cache 精度、更多 kernel 融合、更好的 kernel 以及基于 vLLM 与 NVIDIA Dynamo 的分离式服务;提交截止后针对 GPT-OSS-120B 与 DLRMv3 的优化继续带来提升。 将性能提升归因于可复用的软件栈改进(精度、kernel、服务架构),说明同一硬件在版本迭代中仍能获得收益,而不只是依赖新芯片。 v6.1 相对 v6.0 的 1.6 倍提升属于已提交结果;提交截止后的 GPT-OSS-120B 与 DLRMv3 结果文中明确标注“尚未经 MLCommons 验证”。
面向智能体(agentic)推理的测量正在形成:在 SemiAnalysis AgentX 预览测试中,Vera Rubin NVL72 性能为 GB300 NVL72 的 30 倍;即将推出的 MLPerf Endpoints 基准将为智能体推理负载提供标准化测量。 把评估对象从传统吞吐量扩展到“推理、规划、多步行动”的智能体工作负载,并指出标准化基准尚在建立中。 AgentX 数据来自预览测试而非 MLPerf 提交;MLPerf Endpoints 被描述为“即将推出”,因此该部分属于方向性信号而非已确立的基准结论。
启示与展望
本文适用于正在评估机架级推理基础设施的读者:它给出 Vera Rubin NVL72 相对 GB300 NVL72 的吞吐量倍数、GB300 NVL72 从 72 GPU 到 288 GPU 的扩展效率,以及 v6.1 相对 v6.0 的软件增益,可用于容量与成本/令牌的初步估算。其设定是 MLPerf Inference v6.1 Closed Division 的特定基准与 NVIDIA 自有软硬件栈(vLLM、Dynamo、TensorRT-LLM、NVFP4、NVLink),并覆盖从 Jetson AGX Thor 边缘设备到 NVL72 机架的部署范围。
读者仍需留意:Vera Rubin NVL72 的结果被表述为“预览”,最终提交成绩可能不同;提交截止后针对 GPT-OSS-120B 与 DLRMv3 的结果“尚未经 MLCommons 验证”;AgentX 的 30 倍来自预览测试而非 MLPerf 提交;MLPerf Endpoints 基准尚未发布,智能体推理的标准化测量方式仍待明确。此外,本文为新闻稿式文章,未提供各基准的绝对吞吐量数值、功耗或成本数据,因此无法据此独立核算每令牌成本。
