arXiv 2026年6月17日该工作提出通用奖励推断与解耦方法 GRID,通过信息瓶颈把每个智能体的奖励函数分解为所有智能体共享的通用奖励与体现个体偏好的特定奖励,仅用通用奖励训练即可得到内化安全与基本任务能力等通用环境胜任力的通用智能体,并在合成基函数分解、多智能体 Craftax、MuJoCo Gym 连续控制与 Highway-Env 自动驾驶模拟器实验中成功以语义有意义的方式解耦奖励结构、优于标准示范学习基线,并支持更高效稳定的下游任务专门化。该工作提出通用奖励推断与解耦方法 GRID,通过信息瓶颈把每个智能体的奖励函数分解为所有智能体共享的通用奖励与体现个体偏好的特定奖励,仅用通用奖励训练即可得到内化安全与基本任务能力等通用环境胜任力的通用智能体,并在合成基函数分解、多智能体 Craftax、MuJoCo Gym 连续控制与 Highway-Env 自动驾驶模拟器实验中成功以语义有意义的方式解耦奖励结构、优于标准示范学习基线,并支持更高效稳定的下游任务专门化。GRID 从异质示范者群体中分解出通用奖励,实现通用预训练并超越标准示范学习基线该工作提出通用奖励推断与解耦方法 GRID,通过信息瓶颈把每个智能体的奖励函数分解为所有智能体共享的通用奖励与体现个体偏好的特定奖励,仅用通用奖励训练即可得到内化安全与基本任务能力等通用环境胜任力的通用智能体,并在合成基函数分解、多智能体 Craftax、MuJoCo Gym 连续控制与 Highway-Env 自动驾驶模拟器实验中成功以语义有意义的方式解耦奖励结构、优于标准示范学习基线,并支持更高效稳定的下游任务专门化。该工作提出通用奖励推断与解耦方法 GRID,通过信息瓶颈把每个智能体的奖励函数分解为所有智能体共享的通用奖励与体现个体偏好的特定奖励,仅用通用奖励训练即可得到内化安全与基本任务能力等通用环境胜任力的通用智能体,并在合成基函数分解、多智能体 Craftax、MuJoCo Gym 连续控制与 Highway-Env 自动驾驶模拟器实验中成功以语义有意义的方式解耦奖励结构、优于标准示范学习基线,并支持更高效稳定的下游任务专门化。