跳到主要内容
返回时间线
arXiv来源发表:

SkillGym 把人类技能转成可验证训练环境,让 35B 模型在 SkillsBench 上以 51.47% 超过 Claude Sonnet 4.6 等报告分数

核心概要

SkillGym 提出一个把人类编写的 agent 技能转化为可执行、可验证训练环境的框架,通过技能到任务流水线生成具体任务、用代码检查器验证结果并以对比执行衡量技能依赖,构建并发布 12 个类别共 2756 个环境和 8364 条成功轨迹(平均 49 次工具调用、超过 60k 文本 token),支持在已验证工作流上做监督微调与基于结果奖励的强化学习;在 Claude Code 下,监督微调使 Qwen3.5-35B-A3B 在 GDPval-AA v2 上提升 199 Elo、在 Terminal-Bench 2.1 上提升 19.10 个百分点、在 SkillsBench v1.1 上带技能与不带技能分别提升 28.13 和 12.38 个百分点,其 35B 的

Source-provided article image: SkillGym: Internalizing Human Skills into LLMs for Real-World Problem Solving
Figure 1 ·

Figure 1: Performance on general-agent benchmarks.

arXiv

深度剖析

SkillGym 把人类编写的 agent 技能从推理时的外部指令转变为可执行、可验证的训练环境,其技能到任务流水线会实例化具体任务、用代码检查器验证结果,并通过对比执行评估经验性的技能依赖。 此前技能通常作为外部推理时指令使用,而不是被内化为可复用的模型能力;该工作把技能本身变成训练环境与验证信号。 摘要描述了流水线的三个环节(实例化任务、代码检查器验证、对比执行评估技能依赖),并说明这些资源支持监督微调与基于结果奖励的强化学习。

作者构建并发布了 12 个类别共 2756 个环境,并从多个模型与 harness 收集了 8364 条成功轨迹,平均每条 49 次工具调用、记录超过 60k 文本 token。 这提供了一套带验证结果的大规模技能训练与评测资源,而不仅是单一模型或单一任务的演示。 摘要给出了环境数量、类别数、轨迹数量以及平均工具调用与 token 规模的明确数字。

在 Claude Code 下,监督微调使 Qwen3.5-35B-A3B 在 GDPval-AA v2 上提升 199 Elo、在 Terminal-Bench 2.1 上提升 19.10 个百分点、在 SkillsBench v1.1 上带技能与不带技能分别提升 28.13 和 12.38 个百分点。 这些提升来自在已验证工作流上的监督微调,说明技能可以被内化为模型能力,而不仅依赖推理时提供技能。 摘要报告了具体基准名称与数值提升,并指明评测在 Claude Code 下进行。

35B 的 SkillGym-Agent 在带技能的 SkillsBench 上达到 51.47%,超过 Claude Sonnet 4.6、GPT-5.4 Mini 和 DeepSeek V4 Pro 的报告分数;在不带技能时也超过 Codex 与 Claude Code 下带技能的基线,提示可复用的程序性能力。 一个 35B 模型在技能辅助设置下超过更大或更强的报告基线,并且在不提供技能时仍优于带技能的基线,指向技能已被内化而非仅被提示。 摘要给出 51.47% 这一具体分数与对比对象,并说明不带技能时相对基线的表现,但对比分数为“报告分数”而非同一实验条件下的复现。

启示与展望

该工作面向使用大语言模型 agent 解决真实世界任务的训练与评测场景,适用于希望把人类编写的技能沉淀为模型能力的团队;其资源(2756 个环境、8364 条轨迹)与训练配方面向支持监督微调与基于结果奖励强化学习的模型与 harness,摘要中的评测在 Claude Code 与 Codex 等 harness 下进行。

摘要未说明代码检查器覆盖的任务类型边界、对比执行如何量化技能依赖、以及不同 harness 下结果差异的来源;51.47% 是与“报告分数”比较而非同一条件下的复现,读者仍需关注这些对比的可比性。此外,当前可见文本为摘要与页面导航,未包含正文中的方法细节、消融与失败案例分析,因此对训练配方与技能依赖机制的完整理解仍待正文。

来源