arXiv 2026年10月5日Beaver 是一个面向 AI-RAN 场景的 GPU 共享系统,它按每个时隙的调度负载确定 vRAN 的流多处理器(SM)分配、以时隙为粒度重新划分 SM,并改写已编译的 ML 内核以在 vRAN 内存关键阶段让出 HBM 带宽;在 H200 上使用 NVIDIA Aerial、异构多小区负载、真实蜂窝轨迹、生产推理内核与全栈 LLM 服务进行评估时,它把 vRAN 的 p99.9 时延保持在 1.5ms 上行截止时间内,同时保留 Llama-3.3-70B 服务吞吐的 74%,在回放蜂窝轨迹下未观察到截止时间违约,保护 375us 下行截止时间,并可推广到 A100、GB10 与 GH200。Beaver 是一个面向 AI-RAN 场景的 GPU 共享系统,它按每个时隙的调度负载确定 vRAN 的流多处理器(SM)分配、以时隙为粒度重新划分 SM,并改写已编译的 ML 内核以在 vRAN 内存关键阶段让出 HBM 带宽;在 H200 上使用 NVIDIA Aerial、异构多小区负载、真实蜂窝轨迹、生产推理内核与全栈 LLM 服务进行评估时,它把 vRAN 的 p99.9 时延保持在 1.5ms 上行截止时间内,同时保留 Llama-3.3-70B 服务吞吐的 74%,在回放蜂窝轨迹下未观察到截止时间违约,保护 375us 下行截止时间,并可推广到 A100、GB10 与 GH200。Beaver 在 H200 上让 vRAN 与 Llama-3.3-70B 共享 GPU,保住 1.5ms 上行时延并保留 74% 吞吐Beaver 是一个面向 AI-RAN 场景的 GPU 共享系统,它按每个时隙的调度负载确定 vRAN 的流多处理器(SM)分配、以时隙为粒度重新划分 SM,并改写已编译的 ML 内核以在 vRAN 内存关键阶段让出 HBM 带宽;在 H200 上使用 NVIDIA Aerial、异构多小区负载、真实蜂窝轨迹、生产推理内核与全栈 LLM 服务进行评估时,它把 vRAN 的 p99.9 时延保持在 1.5ms 上行截止时间内,同时保留 Llama-3.3-70B 服务吞吐的 74%,在回放蜂窝轨迹下未观察到截止时间违约,保护 375us 下行截止时间,并可推广到 A100、GB10 与 GH200。Beaver 是一个面向 AI-RAN 场景的 GPU 共享系统,它按每个时隙的调度负载确定 vRAN 的流多处理器(SM)分配、以时隙为粒度重新划分 SM,并改写已编译的 ML 内核以在 vRAN 内存关键阶段让出 HBM 带宽;在 H200 上使用 NVIDIA Aerial、异构多小区负载、真实蜂窝轨迹、生产推理内核与全栈 LLM 服务进行评估时,它把 vRAN 的 p99.9 时延保持在 1.5ms 上行截止时间内,同时保留 Llama-3.3-70B 服务吞吐的 74%,在回放蜂窝轨迹下未观察到截止时间违约,保护 375us 下行截止时间,并可推广到 A100、GB10 与 GH200。