驯服智能体化RAN:O-RAN中自主AI智能体的稳定性保证仲裁
核心概要
该工作在真实O-RAN测试床上演示了两个各自目标正确的自主智能体(一个保护时延SLA、一个追求能效利用率)会共同引发共享资源划分的反复反向偏移,并提出并证明了一个轻量仲裁层AURA,通过可行性不变量、逐变量驻留时间和死区三项准入检查,将共享状态偏移幅度从8.4降至0.4 PRB、将跨切片吞吐饥饿从40–55%降至0.3%,同时不改善受保护切片自身的时延合规率。
Fig. 1: AURA architecture. Autonomous AI agents ( A sl A_{\mathrm{sl}} , A en A_{\mathrm{en}} ) in the Non-RT RIC submit proposals to a central arbiter, which enforces three conditions (feasibility invariant, dwell time, deadband) with SLA-restoring actions taking priority. Admitted proposals update a shared quota table reloaded by the OAI gNB; the NR MAC downlink pre-processor enforces per-slice PRB quotas. One-way latency ( ℓ 1 \ell_{1} ) is measured via a dedicated UDP probe to UE 1 ; slice-2 throughput ( r 2 r_{2} ) is read at UE 2 ; MAC statistics return via E2 to FlexRIC and feed a shared telemetry store read by both agents.
arXiv深度剖析
在运行中的5GSA O-RAN栈上首次端到端实证了多智能体RAN不稳定:两个单独运行都正确的智能体共同导致共享资源划分反复偏移。 此前冲突缓解工作假设应用群体静态已知、可离线分析,而该工作展示的是运行时涌现的智能体冲突,且用真实测量的一次性时延和吞吐而非模型代理量来验证。 在OAI/FlexRIC测试床上以真实测量的一次性时延和吞吐进行实验,每个配置重复5次共20次运行;Direct下共享上限C的稳定幅度为8.4 PRB,第二个独立负载周期内仍有2.0 PRB平均偏移,5次中有3次至少偏移2 PRB(逐次为0、2、0、2、6);单独运行任一智能体时偏移为零。
将该病理形式化为延迟对立最佳响应过程,给出极限环证明(命题1)与仲裁系统的收敛保证(命题2)。 把切换系统稳定化中的驻留时间条件等经典工具映射到O-RAN控制平面,识别共享变量结构、延迟来源,并证明被准入动作序列有限终止。 命题1给出极限环幅度下界δ·⌈τ_loop/T_a⌉;命题2在τ_d>τ_loop且0<ε≤min(δ,δ_c)下证明有限改进性质与终止性;实验中将τ_d=8 s设为高于实测约7 s的τ_loop,并作为实验强制前置条件。
在OAI NR MAC下行预处理中实现了上游OAI缺失的逐切片PRB配额强制,并测量了从智能体决策到MAC强制的完整控制环时延预算。 指出当前上游OAI的E2切片服务模型是仿真器(指示消息填随机数据、控制消息仅确认而不触及MAC),因此在该路径上不验证强制就做多智能体研究等于什么都没测;该工作直接实现强制并将E2回调重接到同一配额表。 单UE扫描中配额从13升至38 PRB使接收端有效吞吐从17.0升至43.1 Mbps(2.54倍,与配额比一致),MAC每时隙分配计数器精确跟踪配置配额;仲裁准入逻辑本身开销相对约265 ms的强制步骤可忽略。
AURA以显式承认的代价换取系统级可行性:大幅抑制共享状态偏移并几乎消除跨切片吞吐饥饿,但不改善受保护切片自身的时延合规。 揭示单切片SLA指标无法捕捉跨切片成本:Direct下切片1违规率名义上更低(84.5%对AURA的92.9%)是以切片2被40–55%吞吐饥饿为代价换来的,并非真实收益。 AURA将切片2吞吐违规从Direct和Single下的40–55%降至0.3%;在AURA稳定工作点(q1,q2,C)=(26,18,44)的静态对照运行显示切片1时延与Static的差距缩小到4.2个百分点但未消除。
启示与展望
该结果面向在共享延迟观测环上运行、目标相互矛盾的自主控制器,适用于多秒级时间尺度的切片配额与能耗上限决策,而将亚秒级调度留给近实时RIC。它使运营商和RIC开发者能够在动作到达网络前设置一个可证明正确的准入边界,且该边界对智能体内部逻辑不可知,因此对规则型与学习型智能体同样适用。作者指出该框架可迁移到功率控制对干扰管理、流量引导对节能等共享网络状态的场景,并计划扩展到多UE、多小区、多智能体的空口测试床。
实验固定T_a=5 s,未扫描T_a与步长(δ,δ_c)以检验命题1预测的幅度缩放,也未量化冲突率随智能体规模的变化,作者明确不声称平台级并发智能体数量。当前智能体为规则型,仲裁器对学习型策略的保证尚待用DRL或LLM规划器在空口测试床上验证。强制路径为文件驱动,约265 ms的强制步骤是τ_loop瓶颈,生产级E2路径需重新测量该分量。切片1时延与Static之间残留的4.2个百分点差距归因于静态对照中不存在的实时动态效应,精确归因留待未来工作。
