SkillGym 把 18.4 万个社区技能变成可验证训练环境,9B 微调模型在两个基准上超过 397B 未训练模型
核心概要
SkillGym 提出一条自动流水线,从互联网抓取技能并筛选出可离线复现的部分,用 builder-reviewer 智能体系统围绕四种推理结构构造带参考解与可执行验证器的技能关键型任务,再用三个教师模型和四个 agent harness 采集成功轨迹做监督微调,使 2B 到 122B 的六个模型在四个技能使用基准上 24 项比较中 22 项提升,其中 9B 模型在 SkillGym 测试集与 SkillEval 上超过 Qwen3.5-397B-A17B,并把智能体读取相关技能的比例从 28% 提高到 96%。
深度剖析
SkillGym 把社区编写的技能反向转化为训练环境:先抓取技能,再围绕技能构造任务,而不是从智能体自身在固定环境中的经验里提炼技能。 既有技能使用训练方法多从智能体自身经验或少量固定环境中派生技能,SkillGym 则保持技能外部化,覆盖 18 个领域、3.5k 技能,并让学到的行为迁移到训练中未出现的技能。 论文报告从两个来源抓取 184,430 条技能清单,去重后 51,131 条可获取,经筛选与跨源去重后得到 11,897 条技能,其中 3,494 条生成了任务,共 6,772 个任务;技能筛选要求无运行时网络、无 GPU、非破坏性且文件数不超过 300。
任务构造采用 builder-reviewer 双阶段智能体系统,围绕程序执行、溯因诊断、约束满足、偏序规划四种推理结构生成任务,每个任务都带参考解和可执行验证器。 论文指出既有工作各自聚焦单一推理结构,尚未把多种结构结合起来合成可验证、以技能为根基的任务;SkillGym 用有效性门(初始工作区必须让验证器失败、参考解必须让它通过)加质量门(检查信息泄漏、过严或过弱的检查)来约束任务质量。 论文报告 6,772 个任务中 5,191 个通过、1,581 个未解决;任务指令中位长度 336 词,验证器代码中位 281 行;消融显示在相同 token 预算下,训练于通过质量审查的任务比只通过有效性验证的任务在测试集上高 4.7 分、SkillEval 高 6.7 分、Skill-Use-Bench 完成度高 9.3 分。
在采集的成功轨迹上做监督微调,能提升不同家族、不同规模模型的技能使用表现,且增益延伸到训练中未出现的技能。 论文报告训练在 24 项比较中 22 项带来提升,平均增益为 SkillGym 测试集 13.8 分、SkillEval 9.7 分、SkillsBench 9.7 分、Skill-Use-Bench SU 41.2 分;9B 模型在 SkillGym 测试集与 SkillEval 上超过 Qwen3.5-397B-A17B。 六个骨干模型来自三个家族、参数从 2B 到 122B;按技能划分,held-in 成功率从 40.0% 升到 57.0%,held-out 从 42.5% 升到 62.0%;提供技能时 SFT 模型成功率从 43.0% 升到 59.5%,而基座模型从 33.8% 升到 41.3%。
训练最大的行为变化是智能体开始主动查阅被提供的技能,并且这种增益跨推理结构成立。 论文把 Skill-Use-Bench 分数拆成三项,其中 Trigger 从 28.0 升到 96.0,Compliance 从 32.5 升到 49.0,Boundary 从 57.7 升到 64.0;用统一评分标准标注三个基准后发现,SFT 在每种结构上都提升约 16.9 到 22.1 分(SkillGym)和 15.4 到 16.4 分(SkillEval),控制任务难度后没有结构特异性效应。 增益也到达训练中稀少的结构:规则应用只占训练任务的 12%,而 SkillEval 的规则应用任务仍提升 13.9 分;在 SkillsBench 上,提供参考文档的技能任务提升 28.0 分,而需要领域方法、随附工具或修改既有系统的任务没有提升。
启示与展望
这条流水线面向希望训练技能使用智能体的研究者与工程团队,适用于技能可离线复现、无 GPU 与网络依赖、非破坏性的场景;论文明确把技能保持为外部资源,训练的是通用技能使用能力而非把某个技能编译进权重。任务构造覆盖程序执行、溯因诊断、约束满足、偏序规划四种结构,验证器以结果为准并允许替代解。论文给出的成本估计为 5.7k 到 8.4k 美元、约每个发布任务 1 美元,不含环境构建、标注与评测,这为在相近预算下复现或扩展提供了参照。
论文指出两个开放方向:SkillsBench 上的增益集中在提供参考文档的技能,围绕领域方法或随附工具构建的技能提升很小;训练只用了监督微调,而在验证器已提供结果奖励的 SkillGym 环境上做强化学习是自然的下一步。消融实验使用 token 匹配的子集,规模远小于完整数据,所有消融模型都低于完整 SkillGym 模型,论文因此建议把消融读作每对内部的比较。此外,任务结构标注由 GPT-5.4 完成,论文报告其标注的检查数量在 100 个 SkillEval 任务中有 99 个与评测器规格一致。
