跳到主要内容
返回时间线
arXiv来源发表:

RRM-GPT 用自回归模型逐字段生成 5G NR 调度授权,并在未见过场景中迁移所学行为

核心概要

作者提出 RRM-GPT,一个把无线资源管理决策当作语言逐字段生成的自回归框架:编码器将异构网络观测映射为统一 token,解码器按网络状态与已生成字段依次输出决策;在 5G NR 案例中,单一模型生成涵盖用户选择、时序、链路自适应、资源分配与控制信令的完整调度授权,并无需适配即把所学行为迁移到未见过场景。

Source-provided article image: RRM-GPT: A Framework and Vision for Radio Resource Management Foundation Models
Fig. 1 ·

Fig. 1: Overview of the proposed autoregressive framework for RRM. Network state is encoded, and feasible, standard-compliant decisions are generated field by field. The formulation supports function-specific models with separate weights and, at its broadest scope, a shared model across functions. Models are pretrained on network logs and post-trained for a deployment objective.

arXiv

深度剖析

提出 RRM-GPT 自回归框架,把 RRM 决策建模为逐字段生成的序列,先在大规模网络日志上预训练,再针对部署目标做后训练。 以往学习型 RRM 模型通常为单一功能与单一部署定制,换功能或换部署就要重走数据、目标、训练、验证的工程流程;该框架把决策生成统一为下一字段预测,使同一模型可跨部署复用。 属于框架与愿景层面的方法学贡献,作者以结构观察(决策由标准定义的相互依赖字段构成)和两阶段训练流程论证,未给出跨功能复用的实验证据。

给出网络观测与 RRM 决策的统一表示:分类值经学习字典编码,连续值按学习区间的位置编码以保留量级,占用图按块编码以保留布局,相关特征再分组投影到共同嵌入空间形成输入 token。 文本输入有预定义词表,而 RRM 输入异构且随用例变化;该表示让调度、干扰协调、切换等不同功能共享同一生成机制,输出 token 的取值来自 3GPP 标准与网络配置。 以表 I 逐项对照语言模型与调度、干扰协调、切换的输入、token、词表、完整序列、规则与序列结束符,属概念性对应论证。

在 5G NR 案例中,单一模型生成完整调度授权,覆盖用户选择、数据时隙偏移、MCS、PRB 数量、起始 PRB、控制信道聚合等级与起始 CCE,并捕捉字段间依赖。 此前自回归 Transformer 生成调度决策时为每个调度子任务配专用模型;这里用一个模型按固定字段顺序生成整条授权,并以链式分解精确刻画 token 间依赖,不引入独立性假设。 训练集约 650 万条授权,同场景留出集 63.7 万条;时序、聚合等级与重传 MCS 在 rollout 下准确率较高,上行起始 PRB 准确率在 teacher forcing 下由 48% 升至 99%,MAE 由 2.8 降至 0.1 个 PRB 索引,作者据此认为 rollout 误差多来自误差传播。

模型无需适配即可迁移到训练中完全排除的静态用户、半径 167 m 小区场景,多数指标提升,但迁移并不均匀。 这为跨部署复用提供了初步依据:初始传输 MCS 准确率下行由 40% 升至 68%、上行由 47% 升至 91%,说明模型未记住训练场景;同时上行起始 PRB 准确率由 48% 降至 37%,显示迁移存在方向性差异。 迁移测试集为 15.8 万条授权,来自与训练不同的场景;作者将提升部分归因于静态用户与更小小区带来更稳定的信道条件。

启示与展望

该框架面向希望减少重复工程投入的网络厂商、运营商与研究者:功能特定范围内,一个调度模型可预训练于网络日志并适配到不同小区配置、环境与流量条件;更广的目标是让负载管理、切换、干扰协调与调度共享一个模型,按各自控制机会被调用,生成顺序遵循功能间依赖,慢速决策不必每时隙重生成。案例结论适用于所仿真的 3.5 GHz、40 MHz、106 PRB 城市宏小区与 100 KB FTP 业务设定,以及训练中排除的静态用户、半径 167 m 场景。可行性方面,解码时对违反当前约束的取值做掩码,并由轻量状态跟踪器记录已选字段与资源占用,作者称训练充分的模型大多自行遵守规则,掩码很少改变结果,但罕见违规仍可能扰乱网络运行,因此这类轻量保证对实际部署是必要的。

跨功能共享模型尚未实验验证,其收益来自对功能间互补与替代关系的论证而非测量。后训练(行为克隆与强化学习)被描述为部署适配路径,但案例未报告后训练结果,也未报告对吞吐、时延等网络 KPI 的影响。迁移评估仅覆盖一个静态小小区场景,作者明确表示更广的泛化、后训练收益与网络性能影响留待未来评估。表示设计中的字段选择、粒度与顺序仍是设计问题,跨标准版本与跨系统(Wi-Fi、卫星)迁移能否成立尚不清楚。日志覆盖与细节、不同厂商与部署日志如何合并、每时隙推理预算下的复杂度与延迟、多实例部署时本地观测间的一致性,以及如何表达运营商意图并在不进行在线不安全探索的前提下适配,均被列为开放问题。此外,文中公式(1)与部分符号在提供的文本中未完整呈现,若需复现链式分解细节,应查阅原文图表与公式。

来源