arXiv 2026年10月5日该文提出 FARM,一种把跨任务知识复用从策略空间转移到轨迹级决策评估的奖励空间迁移框架:其 Agentic Reward Model 先从异构源任务轨迹中学习任务条件化的奖励先验,冻结后用于指导未见目标任务的控制策略适配;在异构 MEC 任务上,FARM 在未见 Rate-Latency 目标上相对单任务 SAC 取得 29.8% 的平均后期增益,高于 CRA Transfer 的 16.1%,在中等分布外 FAR-M 情形取得 46.2% 增益,且 Mamba 与 Transformer 轨迹编码器均支持该迁移,Mamba 在更长历史依赖下更稳健。该文提出 FARM,一种把跨任务知识复用从策略空间转移到轨迹级决策评估的奖励空间迁移框架:其 Agentic Reward Model 先从异构源任务轨迹中学习任务条件化的奖励先验,冻结后用于指导未见目标任务的控制策略适配;在异构 MEC 任务上,FARM 在未见 Rate-Latency 目标上相对单任务 SAC 取得 29.8% 的平均后期增益,高于 CRA Transfer 的 16.1%,在中等分布外 FAR-M 情形取得 46.2% 增益,且 Mamba 与 Transformer 轨迹编码器均支持该迁移,Mamba 在更长历史依赖下更稳健。FARM 用奖励空间迁移替代策略迁移,在未见 Rate-Latency 任务上取得 29.8% 的后期增益该文提出 FARM,一种把跨任务知识复用从策略空间转移到轨迹级决策评估的奖励空间迁移框架:其 Agentic Reward Model 先从异构源任务轨迹中学习任务条件化的奖励先验,冻结后用于指导未见目标任务的控制策略适配;在异构 MEC 任务上,FARM 在未见 Rate-Latency 目标上相对单任务 SAC 取得 29.8% 的平均后期增益,高于 CRA Transfer 的 16.1%,在中等分布外 FAR-M 情形取得 46.2% 增益,且 Mamba 与 Transformer 轨迹编码器均支持该迁移,Mamba 在更长历史依赖下更稳健。该文提出 FARM,一种把跨任务知识复用从策略空间转移到轨迹级决策评估的奖励空间迁移框架:其 Agentic Reward Model 先从异构源任务轨迹中学习任务条件化的奖励先验,冻结后用于指导未见目标任务的控制策略适配;在异构 MEC 任务上,FARM 在未见 Rate-Latency 目标上相对单任务 SAC 取得 29.8% 的平均后期增益,高于 CRA Transfer 的 16.1%,在中等分布外 FAR-M 情形取得 46.2% 增益,且 Mamba 与 Transformer 轨迹编码器均支持该迁移,Mamba 在更长历史依赖下更稳健。