跳到主要内容
返回时间线
arXiv来源发表:

Long-MDR 把多模态深度研究智能体的在线强化学习推到 128k 上下文与 75 轮工具交互,9B 模型在 50 轮评测预算下于六个基准中的五个领先同规模智能体

相关研究与后续进展

核心概要

该工作把多模态深度研究智能体的在线强化学习训练扩展到 128k 上下文与 75 轮以上工具交互,并提出由同策略蒸馏预热、渐进式视野扩展和熵触发回滚救援三部分组成的 Long-MDR 训练配方,以缓解长视野训练早期奖励上升缓慢与后期熵坍缩的问题;在 50 轮工具交互评测预算下,训练得到的 Long-MDR-9B 在六个基准中的五个上位列所比较的 7B–9B 智能体之首。

Source-provided article image: Long-MDR: Long-Context Reinforcement Learning for Multimodal Deep-Research Agents

[Uncaptioned image]

arXiv

深度剖析

作者把在线多模态深度研究强化学习训练扩展到 128k 上下文和 75 轮以上工具交互,并称这是首个在该上下文长度和该工具轮数视野下训练的在线多模态深度研究强化学习研究。 此前多模态研究智能体的在线强化学习大多局限于更短的上下文与交互视野,本文把训练规模推高到 128k 上下文与 75 轮工具交互。 论文以自述方式给出这一规模声明,并配合五阶段训练配置(工具预算从 25 增至 50 再到 75 轮、上下文上限 128k)与训练动态分析作为支撑。

Long-MDR 由三个组件构成:同策略蒸馏预热、渐进式视野扩展、熵触发回滚与救援,用于提升长视野强化学习的学习效率与稳定性。 作者指出直接套用常规强化学习配置在该规模下会出现两个现象:早期奖励上升极慢,以及后期熵坍缩导致奖励在性能饱和前停滞;三个组件分别针对冷启动、过早暴露于长轨迹和探索停滞。 论文给出各组件的形式化目标(含奖励自适应的 token 级蒸馏优势、按阶段增长的工具预算、基于训练统计而非下游基准分数的坍缩触发),并报告训练动态中奖励、验证性能、熵与工具使用量的变化趋势。

在 50 轮工具交互评测预算下,Long-MDR-9B 在六个基准中的五个上位列所比较的 7B–9B 智能体之首。 该结果把长视野训练配方转化为同规模组内的领先基准表现,而对比对象包括 DeepVoyager-VL、SimpleSearch-VL、POINTS-Seeker 等 7B–9B 多模态研究智能体。 结果来自论文表 1 的基准对比,评测上限为 50 轮工具交互,超过该上限的轨迹被截断并计为错误;表中同时列出专有模型直接作答与智能体工作流两组参照。

训练动态分析显示训练经历引导、扩展、救援三个阶段,且熵救援后策略熵恢复、奖励重新上升、验证性能提高。 作者把熵下降与奖励停滞同时出现的情形识别为过早熵坍缩,并主张策略收敛与熵坍缩并非同一事件,因此采用状态相关的熵干预而非全程熵正则。 论文报告回滚到坍缩前检查点并以更强熵奖励和更低学习率继续训练后,熵恢复、KL 增长放缓、验证性能高于原继续训练;同时给出每步 rollout 耗时(步骤 1–5 为 14.8 分钟,步骤 6–25 为 25.3 分钟,步骤 17 达 36.2 分钟)以说明计算代价。

启示与展望

该工作面向固定模型、工具环境与最大交互预算下的在线多模态深度研究强化学习,训练规模为 128k 上下文与 75 轮以上工具交互,评测在 50 轮工具交互预算下进行。它适用于需要长交互历史、多轮搜索与视觉证据检查的研究型智能体训练场景,尤其是 rollout 成本高昂、单步可耗时数十分钟的设置。其价值在于给出可操作的阶段化训练流程:先用同策略蒸馏预热建立基本研究行为,再随策略能力逐步扩大工具预算,并在熵下降与奖励停滞同时出现时回滚救援。

论文中若干公式、系数与阈值在所提供的文本中以占位形式出现,具体数值无法从该文本完整核对;表 1 的评测使用 50 轮工具交互上限,而训练最终预算为 75 轮,BC-V3 的验证值在不同交互预算下对应不同设置,跨设置比较需谨慎。熵救援的自动触发控制器被描述为可选方案,其窗口、耐心与容差为待定参数。附录案例中工具调用计数在表格与摘要之间存在不一致(表格为 75 条编号条目,摘要报告 76 次调用),提示轨迹统计口径仍需统一。这些属于范围与开放问题,而非对工作的否定。

来源