arXiv 2026年10月5日该工作提出 Wayfarer——一个通用、领域无关的在线深度强化学习智能体,它从高维观测中通过拉普拉斯表示学习发现选项(options)并将其用于控制,作者报告这些选项同时改善探索、加速信用分配并有效泛化到未见情形,从而更快学到复杂策略,并在最具挑战性的 Atari 2600 游戏中取得单流智能体中的最优表现,在 Montezuma's Revenge 和 Private Eye 等需要长时程探索与策略行为的游戏上增益最大。该工作提出 Wayfarer——一个通用、领域无关的在线深度强化学习智能体,它从高维观测中通过拉普拉斯表示学习发现选项(options)并将其用于控制,作者报告这些选项同时改善探索、加速信用分配并有效泛化到未见情形,从而更快学到复杂策略,并在最具挑战性的 Atari 2600 游戏中取得单流智能体中的最优表现,在 Montezuma's Revenge 和 Private Eye 等需要长时程探索与策略行为的游戏上增益最大。Wayfarer 通过拉普拉斯表示学习在线发现选项,在 Montezuma's Revenge 等长时程探索类 Atari 2600 游戏中取得单流智能体最优表现该工作提出 Wayfarer——一个通用、领域无关的在线深度强化学习智能体,它从高维观测中通过拉普拉斯表示学习发现选项(options)并将其用于控制,作者报告这些选项同时改善探索、加速信用分配并有效泛化到未见情形,从而更快学到复杂策略,并在最具挑战性的 Atari 2600 游戏中取得单流智能体中的最优表现,在 Montezuma's Revenge 和 Private Eye 等需要长时程探索与策略行为的游戏上增益最大。该工作提出 Wayfarer——一个通用、领域无关的在线深度强化学习智能体,它从高维观测中通过拉普拉斯表示学习发现选项(options)并将其用于控制,作者报告这些选项同时改善探索、加速信用分配并有效泛化到未见情形,从而更快学到复杂策略,并在最具挑战性的 Atari 2600 游戏中取得单流智能体中的最优表现,在 Montezuma's Revenge 和 Private Eye 等需要长时程探索与策略行为的游戏上增益最大。