跳到主要内容
返回时间线
NVIDIA Technical Blog来源发表:

NVIDIA 用 Dynamo-Triton 26.07 把 TensorRT 多设备推理接入单一 gRPC 端点,Cosmos 3 Nano 视频生成端到端延迟从 156.595 秒降到 34.183 秒

核心概要

NVIDIA 介绍了 TensorRT 多设备推理(自 TensorRT 11.0 起全面支持)与 Dynamo-Triton 26.07 的集成:一个 KIND_MODEL 实例可拥有多块 GPU,创建按 rank 的 TensorRT 执行上下文、CUDA 流和 NCCL 通信器并统一启动,应用只需通过一个 gRPC 端点调用模型;在 Cosmos 3 Nano 视频生成示例中,36 层去噪 transformer 用 Ulysses 上下文并行把 44,160 个视频 token 分布到最多八块 GPU,端到端延迟从单 GPU 的 156.595 秒降至八 GPU 的 34.183 秒(4.58 倍),transformer RPC 加速 6.09 倍,CP2/CP4/CP8 均通过

AI-generated editorial illustration: Simplifying Model Serving Across Multiple GPUs with NVIDIA TensorRT Multi-Device Integration in NVIDIA Dynamo-Triton

深度剖析

Dynamo-Triton 26.07 让 TensorRT 后端启用多设备推理:一个 Triton KIND_MODEL 实例可拥有多块 GPU,创建按 rank 的 TensorRT 执行上下文、CUDA 流与 NCCL 通信器,并在每次请求时一起启动各 rank,应用通过一个 gRPC 端点调用一个命名模型,而不再自行协调 GPU rank。 此前多 GPU 加速与可消费的推理服务之间存在落差;该集成把 rank 与通信器生命周期代码从客户端移出,并让引擎以带版本的 Triton 模型形式打包,同时保持应用接口与周边工作流不变。 文中给出 CP8 的 config.pbtxt 片段,显示 backend 为 tensorrt、instance_group 为 KIND_MODEL count 1,并设置 enable_multi_device 为 true、multi_device_gpus 为 0 到 7;这是配置层面的证据,而非独立第三方评测。

在 Cosmos 3 Nano 视频生成示例中,端到端延迟随 GPU 数增加而下降:单 GPU 156.595 秒、CP2 87.999 秒、CP4 53.093 秒、CP8 34.183 秒,对应 1.00x、1.78x、2.95x、4.58x 的端到端加速;transformer RPC 平均耗时从 146.192 秒降至 23.993 秒,RPC 加速达 6.09 倍。 该示例把多设备推理放到一个长序列生成负载上量化:单 GPU 时 transformer RPC 占生成时间 93.4%,CP8 时降至 70.2%,说明加速收益集中在被分布化的 transformer 阶段。 四个变体在同一台健康的八 GPU NVIDIA 系统上运行,统一使用 1280×720 输出、24 FPS 的 189 帧、35 步去噪;每次结果包含一次预热加五次完整生成测量,计时覆盖提示处理、70 次 Dynamo-Triton 调用、CFG 与调度器更新、VAE 解码和帧后处理,但排除了模型加载与 mp4 编码。

分布式 Ulysses 图在部署前被编译进每个 TensorRT plan:引擎由 PyTorch 导出并用 Torch-TensorRT 编译,三个本地转换器把导出载体操作下沉到 TensorRT 公共分布式集合通信层(reduce-scatter、all-to-all、all-gather),每个被接受的上下文并行 plan 包含两个初始 reduce-scatter、36 层 transformer 中每层三个 all-to-all,以及最后一个 all-gather,总计两个 reduce-scatter 加 108 个 all-to-all 加一个 all-gather。 文中明确指出 Dynamo-Triton 配置只是激活该 plan,并不会把单设备引擎转换成分布式引擎,因此分布式拓扑在编译期就已确定。 这是对编译与通信拓扑的机制性描述,配合 CP8 配置片段,属于实现层面的说明,而非与其他框架的对比实验。

上下文并行输出与单设备结果在配置阈值内一致:所有变体使用相同种子与生成 profile,校验采样第 0、47、94、141、188 帧,检查格式与时间变化,并与单设备结果比较;CP2 与 CP4 测得 MAE 12.759、PSNR 21.111 dB,CP8 测得 MAE 16.316、PSNR 19.400 dB,均通过 MAE ≤ 25 与 PSNR ≥ 18 dB 的阈值。 文中明确不声称输出像素级一致,而是以数值阈值和接触表(contact sheet)中一致的连贯动作(机械臂清洗盘子)作为质量证据。 证据为五个采样帧的数值比较与定性观察,样本点有限,且阈值由配置设定。

启示与展望

该能力面向需要缩短单次请求延迟、且愿意用更多 GPU 换取响应时间的团队,适用于延迟敏感的生成式媒体工作流,例如缩短用户等待并加快评审与迭代循环。结果针对文中描述的 Cosmos 3 Nano 长序列负载与同一台八 GPU 系统,配置方式为把分布式图编译进带版本的 TensorRT plan,再由 Dynamo-Triton 以 KIND_MODEL 实例激活;应用侧只需调用一个 gRPC 端点。文中给出复现路径:从 NGC 下载 NVIDIA Dynamo-Triton 26.07,并使用 TensorRT、Torch-TensorRT、Diffusers 与 Cosmos 相关资源。

文中明确说明该基准不测量并发请求吞吐、每个生成视频的成本或总拥有成本,团队仍需按自身 SLO 与部署经济性评估资源换延迟的取舍。计时排除了模型加载与 mp4 编码,因此端到端数字对应的是所界定的测量范围。输出不被声称像素级一致,质量证据来自五个采样帧的 MAE 与 PSNR 以及接触表的定性观察。此外,结果来自同一台八 GPU 系统上的单一模型示例,向其他负载、其他硬件规模或其他并行策略推广时仍需自行验证。

来源