跳到主要内容
返回时间线
NVIDIA 开发者技术博客来源发表:

NVIDIA 与 Nscale 在冰岛实测 DSX MaxLPS:同一 264.4 kW 预算下 GPU 从 140 增至 192,聚合吞吐提升 49.2%

核心概要

NVIDIA 与 Nscale 在冰岛 Keflavík 的 Verne 园区数据中心,用 NVIDIA GB300 NVL72 系统与 Kimi K2.5(FP4)推理负载,对 DSX MaxLPS 策略化动态功率分配做了联合评估:在相同的 264.4 kW 已批准功率预算下,受管 GPU 从 140 块增至 192 块(+37.1%),聚合吞吐从 1,084,503 tokens/s 升至 1,618,443 tokens/s(+49.2%),每已配置瓦特吞吐从 4.10 升至 6.12 tokens/s/W(+49.2%),同时中位数与 P75 延迟保持在基线 5% 以内,但 P99 首 token 时间从 15.7 秒基线上升 17%。

AI-generated editorial illustration: How NVIDIA DSX MaxLPS Maximizes AI Factory Throughput and Efficiency

深度剖析

在固定功率预算下,动态功率分配把闲置余量转化为可用算力:受管 GPU 由 140 增至 192,聚合吞吐提升 49.2%,每已配置瓦特吞吐由 4.10 升至 6.12 tokens/s/W。 相对静态按节点峰值预留的做法,该评估给出了同一 264.4 kW 预算下容量与吞吐的实测对照,而不是仅描述机制。 联合评估在 Nscale 数据中心采集 GPU、节点、机架与组级功率遥测,并同时测量归一化聚合与单实例吞吐、首 token 时间、端到端延迟与交互性;两配置使用同一 264.4 kW 已配置预算作为固定分母。

扩容没有牺牲既有实例的服务水平:高吞吐实例单实例输出 59,153 升至 59,220 tokens/s(+0.1%),低延迟实例维持 2,265 tokens/s(0%)。 说明新增第三个 52-GPU 高吞吐实例后,原有高吞吐与低延迟实例的吞吐在显示精度内基本不变。 单实例吞吐在两种配置下分别测量并对比,且分布式负载在两种配置中都被限制在单个机架内,以控制跨机架性能差异。

收益伴随可观测的代价:平均 GPU 功率由 97.0 kW 升至 131.8 kW(+35.9%),总实测功率由 166.2 kW 升至 198.9 kW(+19.7%),功率预算利用率由 62.9% 升至 75.2%。 把动态分配描述为对既有工程取舍的显式化与可控化,而非消除取舍。 功率数据来自 GPU、CPU 与机架级遥测,并以站点级遥测校验机架级功率测量。

尾延迟是必须单独验证的指标:中位数与 P75 延迟保持在基线 5% 以内,但 P99 首 token 时间上升 17%。 提示稳定的中位数延迟可能掩盖尾延迟变化,生产验收标准应作为研究的一部分预先定义。 评估同时报告 P75 与 P99 分位结果,并给出 P99 首 token 时间相对 15.7 秒基线的变化幅度。

启示与展望

该评估面向在电力受限环境中运营 AI 工厂的运营方与基础设施团队,适用场景是已定义受管边界、具备可靠遥测、并以聚合功率预算为约束的部署。它给出的是可复用的分阶段验证路径:定义受管边界、建立代表性基线、保守引入策略、逐级增加容量并测试、最终设定生产运行限值。文中还指出,动态分配是运营能力,站点仍需为验证后的生命周期目标配置配电、冷却、网络架构、地面空间与机架位置;对未来的 NVIDIA Vera Rubin NVL72,任何容量预测都应与本次 GB300 NVL72 实测分开。

读者仍需关注:可用余量取决于工作负载组合,互补功率曲线比同时达峰的负载机会更多;动态分配依赖可靠遥测,缺失、延迟或错误映射的测量会影响车队级决策;中位数延迟稳定可能掩盖尾延迟变化,本次 P99 首 token 时间上升 17%。此外,本次评估在四个机架内运行且分布式负载被限制在单机架,跨机架等效性能需另行验证;生产验收标准也应在研究中预先定义。

来源