跳到主要内容
返回时间线
arXiv来源发表:

FARM 用奖励空间迁移替代策略迁移,在未见 Rate-Latency 任务上取得 29.8% 的后期增益

相关研究与后续进展

核心概要

该文提出 FARM,一种把跨任务知识复用从策略空间转移到轨迹级决策评估的奖励空间迁移框架:其 Agentic Reward Model 先从异构源任务轨迹中学习任务条件化的奖励先验,冻结后用于指导未见目标任务的控制策略适配;在异构 MEC 任务上,FARM 在未见 Rate-Latency 目标上相对单任务 SAC 取得 29.8% 的平均后期增益,高于 CRA Transfer 的 16.1%,在中等分布外 FAR-M 情形取得 46.2% 增益,且 Mamba 与 Transformer 轨迹编码器均支持该迁移,Mamba 在更长历史依赖下更稳健。

Source-provided article image: FARM: Fundamental Agentic Reward Model For Multi-task Wireless Network Optimization
Fig. 1 ·

Fig. 1: Overview of heterogeneous wireless tasks considered by FARM. The task space spans diverse channel conditions, QoS objectives, constraints, and deployment scenarios. (I) Rayleigh fading models dense urban and mobile MEC environments with rapid non-line-of-sight variations. (II) Rician fading represents line-of-sight-dominant UAV-assisted and air-ground MEC scenarios. (III) Nakagami- m m fading captures adjustable propagation severity in V2X and industrial robotic environments. These heterogeneous tasks support trajectory-level reward learning for Reward-Space Transfer.

arXiv

深度剖析

FARM 将跨任务知识复用从策略空间转移到轨迹级决策评估,用任务条件化的奖励先验而非共享策略来承载可迁移知识。 既有方法主要共享或迁移策略,会把可迁移知识与任务相关的动作映射耦合在一起;FARM 改为在奖励空间迁移,从而把可迁移部分与任务相关动作映射解耦。 该主张由框架设计本身支撑:ARM 从异构源任务轨迹中学习任务条件化奖励先验,并为任务特定策略优化提供辅助指导。

FARM 采用两阶段流程:Stage I 中 ARM 联合建模任务条件、时序轨迹依赖与目标相关奖励结构,各源任务保留自己的控制器;Stage II 中冻结奖励先验,用于指导面向未见任务的目标控制器适配,且不迁移源任务策略。 两阶段设计把奖励先验的学习与目标控制器的适配分开,使迁移发生在冻结的奖励先验上,而不是源任务策略上。 该流程在摘要中被明确描述为 Stage I 与 Stage II 的具体分工,属于方法层面的说明。

在异构 MEC 任务上,FARM 在未见 Rate-Latency 目标上相对单任务 SAC 取得 29.8% 的平均后期增益,而 CRA Transfer 为 16.1%;在中等分布外 FAR-M 情形取得 46.2% 增益。 这些数字给出了奖励空间迁移相对单任务基线与既有迁移方法的量化对比,其中 FARM 的后期增益高于 CRA Transfer。 证据来自摘要报告的异构 MEC 任务实验,包含与单任务 SAC 和 CRA Transfer 的对比数值。

分析显示 Mamba 与 Transformer 轨迹编码器都能支持奖励空间迁移,而随着引入更长的历史依赖,Mamba 表现出更好的稳健性。 该结果说明奖励空间迁移不依赖单一编码器架构,并指出在长历史依赖场景下编码器选择会影响稳健性。 证据来自摘要所述的进一步分析,比较了两种轨迹编码器在奖励空间迁移下的表现。

启示与展望

该工作面向需要在异构信道条件、流量模式、QoS 要求、目标与运行约束之间适配的学习智能体,尤其是多接入边缘计算这类多任务无线网络优化场景。其设定是:源任务各自保留控制器,ARM 从源任务轨迹中学习任务条件化奖励先验,随后冻结该先验来指导未见目标任务的控制策略适配,而不迁移源任务策略。因此它适用于希望复用决策知识、又不愿把任务相关动作映射一并迁移的读者,例如研究多任务与迁移强化学习、无线资源管理与 MEC 优化的人员。摘要层面的结果针对未见 Rate-Latency 目标与中等分布外 FAR-M 情形,说明该框架在这些设定下可用。

当前可见文本为摘要,未包含实验设置、任务数量、训练预算、基线调参方式与统计显著性等信息,因此 29.8%、16.1% 与 46.2% 这些增益所对应的具体评测条件仍需在正文中确认。奖励先验在源任务与目标任务差异更大时是否仍然有效、冻结先验与目标控制器适配之间的权衡如何随任务数变化,都是值得继续观察的问题。Mamba 在更长历史依赖下更稳健这一观察,其适用范围与依赖长度阈值也有待正文说明。

来源