跳到主要内容
返回时间线
arXiv来源发表:

Beaver 在 H200 上让 vRAN 与 Llama-3.3-70B 共享 GPU,保住 1.5ms 上行时延并保留 74% 吞吐

相关研究与后续进展

核心概要

Beaver 是一个面向 AI-RAN 场景的 GPU 共享系统,它按每个时隙的调度负载确定 vRAN 的流多处理器(SM)分配、以时隙为粒度重新划分 SM,并改写已编译的 ML 内核以在 vRAN 内存关键阶段让出 HBM 带宽;在 H200 上使用 NVIDIA Aerial、异构多小区负载、真实蜂窝轨迹、生产推理内核与全栈 LLM 服务进行评估时,它把 vRAN 的 p99.9 时延保持在 1.5ms 上行截止时间内,同时保留 Llama-3.3-70B 服务吞吐的 74%,在回放蜂窝轨迹下未观察到截止时间违约,保护 375us 下行截止时间,并可推广到 A100、GB10 与 GH200。

Source-provided article image: Beaver: Elastic GPU Sharing between ML and Latency-Critical vRAN Workloads
Figure 1 ·

Figure 1: AI-and-RAN co-tenancy setting. Radio units deliver

arXiv · 第 1 页

深度剖析

Beaver 提出一种同时管理计算与内存资源的 GPU 共享系统,用于在共享 GPU 上共置时延关键的 vRAN 与尽力而为的 ML 负载,并保护 vRAN 的严格处理截止时间。 该工作针对 AI-and-RAN 中共置场景的固有不对称性:vRAN 是时延关键负载,而 ML 是面向吞吐的尽力而为共租户;Beaver 将计算与内存两个维度纳入同一套共享管理,而非只处理其中一侧。 摘要说明该系统已实现,并使用 NVIDIA Aerial、异构多小区负载、真实蜂窝轨迹、生产推理内核与全栈 LLM 服务进行评估。

Beaver 依据每个时隙的调度负载来确定 vRAN 的 SM 分配,并以时隙为粒度重新划分 SM 分配。 分配粒度与 vRAN 的时隙调度节奏对齐,使 SM 资源随每个时隙的调度负载变化而调整,而不是采用静态或粗粒度的划分。 摘要将该机制列为系统的核心组成,并在 H200 上以 p99.9 时延是否落在 1.5ms 上行截止时间内作为评估指标。

Beaver 改写已编译的 ML 内核,使其在 vRAN 的内存关键阶段让出 HBM 带宽。 该机制把内存带宽作为可让出的共享资源来处理,与 SM 分配机制并列,构成对计算与内存的联合管理。 摘要将其列为系统机制之一,并在评估中报告在回放蜂窝轨迹下未观察到截止时间违约、且保护 375us 下行截止时间。

在 H200 上,Beaver 在保持 vRAN p99.9 时延处于 1.5ms 上行截止时间内的同时,保留 Llama-3.3-70B 服务吞吐的 74%,并可推广到 A100、GB10 与 GH200。 该结果同时给出时延保护与 ML 吞吐保留两方面的量化表现,并报告跨多种 GPU 的推广性。 摘要报告的具体数值为 74% 吞吐保留、1.5ms 上行截止时间、375us 下行截止时间,以及 A100、GB10、GH200 上的推广;这些是摘要层面的报告值。

启示与展望

该工作面向 AI-RAN 中 AI-and-RAN 的共置设定:在同一 GPU 上同时运行虚拟化无线接入网(vRAN)负载与 AI 服务,其中 vRAN 为时延关键方,ML 为面向吞吐的尽力而为共租户。Beaver 的适用前提是 vRAN 具有按时隙组织的调度负载,因而可以按每个时隙的调度负载确定 SM 分配并以时隙为粒度重划分;同时 ML 侧的内核可被改写以在 vRAN 的内存关键阶段让出 HBM 带宽。摘要报告的保护目标包括 1.5ms 上行截止时间与 375us 下行截止时间,评估环境为 H200 上的 NVIDIA Aerial、异构多小区负载、真实蜂窝轨迹、生产推理内核与全栈 LLM 服务,并称可推广到 A100、GB10 与 GH200。对希望在同一加速器上叠加时延关键无线处理与 AI 服务的工程团队,这提供了可复现的机制方向:以时隙为节拍调整 SM,并在内存关键窗口让出带宽。

本次读取范围仅为摘要,因此 SM 分配的具体算法、内核改写的实现方式、时隙粒度重划分的开销、以及 74% 吞吐保留与各截止时间数值背后的完整实验设置(负载规模、轨迹长度、对照条件)均未在文本中展开,需查阅原文确认。摘要报告的是 p99.9 时延与回放轨迹下未观察到截止时间违约,这类尾部指标在更长轨迹、更多小区或不同 ML 负载组合下的表现仍是开放问题。此外,摘要称可推广到 A100、GB10 与 GH200,但未给出各平台上的对应数值,跨平台一致性有待原文数据支持。

来源