GREQ 两阶段混合框架在 6G 分布式资源管理中实现 40% 吞吐提升与 100% QoS 满足
核心概要
该工作提出 GREQ 两阶段混合模型-学习框架:第一阶段用基于信道统计的贪心算法以最少子信道确定性满足用户 QoS,第二阶段利用 OFDM 子信道间干扰仅来自同子信道这一结构,将大规模 MARL 问题分解为按子信道独立的 QMIX 子问题,从而避免动作空间指数爆炸;在 50MHz 带宽、多种 numerology 的仿真中,GREQ 相比优化与学习基线吞吐提升最高 40%,实现 100% 约束满足,且仅激活 20–80% 的可用子信道。
Fig. 1 : Block-diagram of the proposed hybrid learning framework. Each BS only observes local CSIs and long-term network information.
arXiv深度剖析
提出两阶段混合框架,将 QoS 约束满足从学习中剥离,交由基于信道统计的确定性贪心分配处理,第二阶段只需解决无约束的吞吐最大化问题。 不同于通过机会约束或 CVaR 等风险感知学习直接最小化违约概率的做法,该设计把最难处理的硬约束交给模型化过程,使学习阶段无需复杂奖励塑形与拉格朗日乘子调参。 小规模训练中 GREQ 全程保持零违约率且奖励快速上升,而 MAPPO-Lagrange 奖励显著更低且违约率持续偏高,降低违约率时奖励同步下降。
利用 OFDM 中小区间干扰仅发生在同一子信道的结构,将全局 MARL 问题分解为按子信道独立的子问题,每个子问题用独立 QMIX 实例训练,每个 BS 由每子信道一个智能体控制。 既有工作在全联合动作空间上运行 QMIX 导致计算不可行,或通过限制 TDD、功率档位、每用户至多一个子信道来回避动作空间爆炸;该分解在不牺牲性能的前提下将动作空间从指数级降为线性级。 文中指出 3 个 BS、20MHz、120kHz numerology、每 BS 10 用户时联合动作空间基数约 40 亿;大规模设置下 MAPPO-Lagrange 因动作空间过大被排除出实验。
通过无效动作掩码将第一阶段的分配结果与空闲服务时隙约束直接编码进智能体可行动作集,把值约束转化为动作集约束。 避免了复杂的约束处理机制,使约束可直接通过轻量级掩码技术强制执行,提升训练稳定性与实现可靠性。 该设计在方法层面描述,并与第一阶段贪心分配和固定服务时隙抽象配合,支撑了训练与测试中近乎零的 QoS 违约表现。
在符合 3GPP 的仿真中,GREQ 在吞吐、QoS 满足与资源利用效率上一致优于优化与学习基线,并学会选择性停用子信道以抑制小区间干扰。 基线 RRS、RAND、DOPT 无论负载均激活全部子信道,吞吐约低 30% 且无法满足所有用户 QoS;GREQ 仅激活 20–80% 子信道,因每子信道功率固定,还带来更高效的功率使用。 小规模与大规模设置下均报告 GREQ 吞吐最高、QoS 违约近乎为零、资源使用最少;大规模下 GREQ 仅激活 20–70% 子信道,RRS 与 DOPT 违约率约 3%。
启示与展望
该结果面向多小区下行 OFDM 系统、每 BS 服务时隙数受限、用户随机到达离开且位置与 QoS 波动的设定,适用于共享频谱且无中心协调的分布式部署。第一阶段依赖干扰信道统计(路损)与所有其他 BS 子信道均激活的假设,并引入安全裕度比例以降低真实速率低于 QoS 的风险。作者指出,面向实际部署,训练模型应通过测量活动获得的真实数据微调,并可在 Open RAN 的 RIC 模块中结合多模态或在线学习实时调整策略;对共享频谱的大型网络,可采用分簇的 divide-and-conquer 策略,此时每个 BS 还需估计来自其他簇的干扰统计。
结果均在仿真环境中获得,真实传播环境的模型失配与测量数据微调效果仍需验证。安全裕度比例的选择目前基于数值经验,作者明确表示未做数学分析,其在不同干扰分布下的稳健性值得关注。大规模设置下 MAPPO-Lagrange 因动作空间过大未参与对比,因此该规模下与约束型 MARL 的直接比较仍属开放问题。分簇部署时跨簇干扰统计的估计精度对性能的影响也尚待考察。
