arXiv 2026年10月6日该工作把多模态深度研究智能体的在线强化学习训练扩展到 128k 上下文与 75 轮以上工具交互,并提出由同策略蒸馏预热、渐进式视野扩展和熵触发回滚救援三部分组成的 Long-MDR 训练配方,以缓解长视野训练早期奖励上升缓慢与后期熵坍缩的问题;在 50 轮工具交互评测预算下,训练得到的 Long-MDR-9B 在六个基准中的五个上位列所比较的 7B–9B 智能体之首。该工作把多模态深度研究智能体的在线强化学习训练扩展到 128k 上下文与 75 轮以上工具交互,并提出由同策略蒸馏预热、渐进式视野扩展和熵触发回滚救援三部分组成的 Long-MDR 训练配方,以缓解长视野训练早期奖励上升缓慢与后期熵坍缩的问题;在 50 轮工具交互评测预算下,训练得到的 Long-MDR-9B 在六个基准中的五个上位列所比较的 7B–9B 智能体之首。Long-MDR 把多模态深度研究智能体的在线强化学习推到 128k 上下文与 75 轮工具交互,9B 模型在 50 轮评测预算下于六个基准中的五个领先同规模智能体该工作把多模态深度研究智能体的在线强化学习训练扩展到 128k 上下文与 75 轮以上工具交互,并提出由同策略蒸馏预热、渐进式视野扩展和熵触发回滚救援三部分组成的 Long-MDR 训练配方,以缓解长视野训练早期奖励上升缓慢与后期熵坍缩的问题;在 50 轮工具交互评测预算下,训练得到的 Long-MDR-9B 在六个基准中的五个上位列所比较的 7B–9B 智能体之首。该工作把多模态深度研究智能体的在线强化学习训练扩展到 128k 上下文与 75 轮以上工具交互,并提出由同策略蒸馏预热、渐进式视野扩展和熵触发回滚救援三部分组成的 Long-MDR 训练配方,以缓解长视野训练早期奖励上升缓慢与后期熵坍缩的问题;在 50 轮工具交互评测预算下,训练得到的 Long-MDR-9B 在六个基准中的五个上位列所比较的 7B–9B 智能体之首。