跳到主要内容
返回时间线
arXiv来源发表:

镜像IRS辅助混合RF/VLC网络:双智能体DRL联合优化选择、功率与镜面朝向,公平性指数保持0.93以上

核心概要

该工作面向室内IRS辅助混合RF/VLC下行网络,将RF/VLC技术选择、功率分配与IRS镜面滚转/偏航角朝向的联合比例公平最大化问题建模为MDP,采用集中训练分散执行的双智能体DRL求解:一个智能体负责选择与功率,另一个负责镜面朝向;仿真中该框架收敛到350 Mbps,接近穷举上界392 Mbps,优于DDPG与DQN,并在用户数增加时保持Jain公平性指数高于0.93。

Source-provided article image: Network Adaptation in IRS-Aided Hybrid RF/VLC Systems Using Cooperative Multi-Agent DRL
Fig. 1 ·

Fig. 1: IRS-assisted RF/VLC system model with DRL framework.

arXiv

深度剖析

提出将RF/VLC技术选择、两子网功率分配与IRS镜面滚转/偏航角朝向统一在一个比例公平最大化问题中联合优化,并证明该问题为非凸混合整数非线性规划。 既有混合RF/VLC工作多把VLC信道视为固定不可控,或仅用正弦余弦算法等模型化方法配置IRS,未同时处理IRS重构、技术选择与功率分配。 以式(12)及其约束(12a)-(12g)完整给出问题形式,并逐项说明非凸来源:二进制选择变量、其与功率变量的双线性耦合、以及VLC速率对镜面朝向的非线性依赖。

将问题重构为MDP,并设计集中训练分散执行的双智能体DRL框架:选择与功率智能体处理调度变量,IRS朝向智能体处理镜面角度,二者按先调镜面、后做选择的双时间尺度顺序协作,共享同一合作奖励。 DQN类方法只能处理离散动作,需量化连续功率与角度导致组合爆炸;DDPG类单智能体需在同一异构动作空间内同时学习二进制选择、功率与角度,耦合不同尺度变量。 给出状态空间、两个动作空间(式13、14)、含QoS与功率预算惩罚项的合作奖励(式15)以及训练流程Algorithm 1;并分析训练复杂度与执行时仅需一次前向传播、与信道实现无关。

仿真显示所提框架在总速率与公平性上均优于基线:约2000回合收敛到350 Mbps,处于穷举上界392 Mbps的10%以内,较DDPG与DQN分别高13%与25%,且波动低于5 Mbps。 SCA达到330 Mbps但需每个调度时隙重新求解;DQN因离散动作空间在280 Mbps提前饱和;DDPG稳态速率更高但在SCA基准附近振荡约25 Mbps。 基于Python 3.12与PyTorch 2.0、10000回合×100时间步的训练曲线对比,并给出各算法的收敛值与振荡幅度。

消融与公平性分析量化了IRS智能体的贡献:用户数增加时总速率先升后降并在某点达峰,所提方法峰值415 Mbps;关闭IRS智能体后峰值降至380 Mbps,公平性指数降至0.81,而完整框架在高用户密度下仍高于0.93。 单子网基线中VLC only因带宽更大优于RF only,但两者均低于混合方案,说明技术分集对LoS阻塞用户不可替代。 以Jain公平性指数为指标,在不同用户数下对比所提方法、SCA、关闭IRS智能体、VLC only与RF only,并解释阻塞用户无法被单子网恢复。

启示与展望

该结果面向室内下行IRS辅助混合RF/VLC场景,适用于配备多分支角度分集接收机与RF天线、由中央控制器统一协调的移动用户,用户按随机路点模型移动且LoS阻塞以独立伯努利过程建模。方法的价值在于把离线训练好的策略用于在线执行:训练离线完成,每时隙执行只需各智能体一次前向传播,因而适合信道随用户移动与阻塞持续变化的实时调度。对希望复用该思路的读者,可直接借鉴的是动作空间分解方式——把调度类变量与物理朝向类变量分给不同智能体,并以共享奖励保持协作;以及把约束违反写入奖励的设计。

结果均来自仿真,未涉及硬件原型或实测信道,因此镜面朝向控制精度、MEMS转动时延与真实遮挡统计对性能的影响仍是开放问题。公平性与速率结论建立在特定室内尺寸、AP与IRS阵列配置、用户速度与阻塞概率分布之上,参数改变后的表现需要另行验证。所提方法相对穷举上界仍有约10%差距,且总速率随用户数先升后降,峰值位置与干扰、QoS约束满足难度相关,扩展到更大规模或不同QoS要求时的行为值得进一步观察。此外,集中训练需要全局信道状态信息,分散执行阶段各智能体仅依赖局部观测,观测受限条件下的协调质量仍是可继续考察的方向。

来源