跳到主要内容
返回时间线
arXiv来源发表:

SynCo 让合成器与解题器在同一在线批次中联合优化,八个数学推理基准平均达 78.72%

核心概要

SynCo 把智能体式数据合成与任务求解建模为耦合的多智能体强化学习问题,用同一在线交互批次同时更新一个合成器和一个解题器:解题器获得逐条 rollout 的正确性奖励,合成器获得由任务质量、答案可靠性与结果接地可教性门控的任务级奖励,二者更新再反馈进下一轮合成。在八个数学推理基准上,SynCo 平均准确率 78.72%,高于冻结合成器变体的 75.85% 与最强外部基线 ScaleQuest-Math 的 74.96%,且增益主要来自初始模型未能解出的题目。

Source-provided article image: SynCo: Data Synthesis Co-Training for Self-Evolving LLMs via Multi-Agent Reinforcement Learning
Figure 1 ·

Figure 1: Overview of SynCo , a closed-loop framework for self-evolving LLMs. (1) A Synthesizer first generates capability-guided and verifiable tasks from the current learning context. (2) The resulting interaction batch is then used to jointly update the Synthesizer and the Reasoner through online multi-agent co-training. (3) The updated agents in turn reshape the future curriculum and task distribution, forming an agent–data self-evolution loop.

arXiv

深度剖析

论文把智能体式数据合成与任务学习表述为一个耦合的多智能体强化学习问题,并给出 SynCo:合成器与解题器参数独立,但在同一训练迭代内用各自的组相对策略优化目标更新。 此前多数流程要么使用静态语料,要么在上一轮检查点上生成任务后再训练学习器,合成策略与任务策略并非从同一在线交互中联合优化;SynCo 让二者共享同一在线交互批次。 方法层面给出了问题形式化、能力条件化合成上下文、结构化任务卡、验证准入、智能体专属奖励与联合更新等完整组件,并在附录 B 给出奖励与验证细节。

在八个数学推理基准上,SynCo 平均准确率 78.72%,优于冻结合成器变体 75.85%、最强外部基线 ScaleQuest-Math 74.96% 与 Vanilla 72.36%,并在八个基准中的六个取得最好或并列最好结果。 相对冻结合成器,MATH-500 提升 2.20 分、GSM-Hard 提升 2.05 分、SVAMP 提升 1.67 分,AIME24 与 AIME25 各提升 6.66 分、Minerva 提升 2.57 分;Qwen3-4B 上复现同一趋势,平均从 73.72% 提升到 75.20%。 统一验证协议下报告答案准确率,包含离线合成数据、受控 GRPO 变体、迭代自演化基线与匹配的冻结合成器对照;跨 Qwen3-8B 与 Qwen3-4B 两种规模。

增益主要来自能力获取而非保持:在初始 Qwen3-8B 解错的 878 个样本上,SynCo 解出 283 个(32.23%),冻结变体为 238 个(27.11%);在初始解对的 2,560 个样本上,两者分别为 98.95% 与 98.52%。 56 个额外解出样本中有 45 个来自 Learn 子集,占总体优势的 80.4%,说明联合适应合成策略是把训练经验重新分配到尚未解决但可学习的区域,而非仅巩固已有能力。 按初始模型预测划分基准并做池化与逐基准分解,两种方法均在固定终末检查点评估,避免按基准挑选检查点。

结果接地的可教性信号与产生非退化组相对反馈的任务高度对齐,而静态任务属性不能替代它:2,940 个已验证任务中仅 16.2% 为梯度承载任务,按 SynCo 门控奖励排序可把该比例提高到 62.3%,仅用可教性达 64.6%,而仅用质量或新颖性分别只有 12.8% 与 12.0%。 合成器的事前难度标签只能粗粒度校准难度(可学习组平均成功率 0.625,困难组 0.484),三档难度组的梯度承载率几乎不变(16.8%、16.0%、16.0%),作为预测器精确率仅 16.8%、召回率 22.3%。 基于 2,940 个已验证任务的池化统计与重排序诊断,作者明确说明这是诊断分析而非因果训练消融;可教性与梯度承载指标相关系数为 +0.934。

启示与展望

该结果面向具备可自动验证答案的数学推理训练场景:合成器生成结构化任务卡,验证器检查模式完整性、问题适定性、答案一致性、输出格式与冗余,并可启用独立共识检查过滤参考答案支撑不足的任务。在此设定下,论文表明联合优化合成策略可在与冻结合成器相当的每步开销下(平均更新 45.1 秒对 45.8 秒,中位端到端 343.5 秒对 341.6 秒)把有效任务率从 13.7% 提升到 14.5%,即每批 4.64 对 4.38 个有效任务,并在 100 步内生成 3,200 个候选任务、2,940 个通过验证(接受率 91.9%),无需人工标注或外部 LLM API 调用。对希望把数据合成纳入训练循环、且拥有可靠答案检查器的研究者与工程团队,这提供了一条可复用的闭环设计;对以静态语料或离线增强为主的流程,则提示需要重新审视任务价值的时间非平稳性。

读者仍需关注若干开放问题。课程分析显示,随着解题器变强,梯度承载任务比例从最早分桶的 31.3% 降到最终分桶的 9.5%,全对比例从 34.4% 升到 59.9%,说明维持有信息量的课程会越来越困难;论文也指出只有 16.2% 的已验证任务提供非退化组相对反馈。信号对齐与重排序分析是对已收集任务池的诊断,作者明确说明不应解读为因果训练消融。效率对比中两次运行独立执行,作者提示墙钟差异应视为计算画像相当而非某一变体更快。此外,实证范围限于数学推理与 Qwen3-8B/4B 两种规模,向开放式任务、不可自动验证领域以及更大模型规模的迁移仍是待检验的问题。

来源