arXiv 2026年10月5日该工作提出 SCOUT,一个离线多智能体强化学习框架:它分别训练流匹配行为先验与分解式价值函数,在测试时用 Stein 变分梯度下降把行为样本输运到高价值区域,并以输运步数替代固定正则系数;在个体-全局-最大(IGM)原则下证明了联合软价值差的单项 KL 界随输运收敛而消失、并留有与 IGM 违背成正比的不可约加性残差;实验上在离散与连续离线 MARL 基准上取得最佳平均性能,并在所有离线到在线配置中都有提升。该工作提出 SCOUT,一个离线多智能体强化学习框架:它分别训练流匹配行为先验与分解式价值函数,在测试时用 Stein 变分梯度下降把行为样本输运到高价值区域,并以输运步数替代固定正则系数;在个体-全局-最大(IGM)原则下证明了联合软价值差的单项 KL 界随输运收敛而消失、并留有与 IGM 违背成正比的不可约加性残差;实验上在离散与连续离线 MARL 基准上取得最佳平均性能,并在所有离线到在线配置中都有提升。SCOUT 用测试时动作精炼把生成式行为先验推向高价值区域,在离散与连续离线多智能体基准上取得最佳平均表现该工作提出 SCOUT,一个离线多智能体强化学习框架:它分别训练流匹配行为先验与分解式价值函数,在测试时用 Stein 变分梯度下降把行为样本输运到高价值区域,并以输运步数替代固定正则系数;在个体-全局-最大(IGM)原则下证明了联合软价值差的单项 KL 界随输运收敛而消失、并留有与 IGM 违背成正比的不可约加性残差;实验上在离散与连续离线 MARL 基准上取得最佳平均性能,并在所有离线到在线配置中都有提升。该工作提出 SCOUT,一个离线多智能体强化学习框架:它分别训练流匹配行为先验与分解式价值函数,在测试时用 Stein 变分梯度下降把行为样本输运到高价值区域,并以输运步数替代固定正则系数;在个体-全局-最大(IGM)原则下证明了联合软价值差的单项 KL 界随输运收敛而消失、并留有与 IGM 违背成正比的不可约加性残差;实验上在离散与连续离线 MARL 基准上取得最佳平均性能,并在所有离线到在线配置中都有提升。