Skill2Env 用技能合成 2963 个可执行环境,1.5K 轨迹微调让 35B 智能体七项基准平均从 36.6 升到 45.0
核心概要
Skill2Env 提出以能力需求为导向的框架,从公开技能库筛选技能、用可复用难度模式与任务蓝图联合合成任务指令、执行底座、工作区与评分器,并用求解器执行证据迭代加固任务,最终产出 2963 个可执行任务;用其中 1.5K 条高分轨迹对 Qwen3.6-35B-A3B 做监督微调后,在七个智能体基准上平均分从 36.6 提升到 45.0。
深度剖析
Skill2Env 把智能体的能力需求显式拆成环境理解、规划、技能使用、长程一致性、错误恢复五个维度,并用 100 个可复用难度模式把每个维度落成具体任务挑战,再通过任务蓝图同时约束任务指令、执行底座、工作区和基于评分表的评估器。 此前基于技能的环境合成工作(如 SkillSynth、Terminal-World、FACET、SKT)主要从技能或场景出发扩展任务与环境覆盖,Skill2Env 则把“要考验智能体哪种能力”作为合成的组织轴,让同一技能在不同难度模式组合下生成不同能力取向的任务。 论文给出五维能力需求表与 100 个难度模式的构造与加固控制项,并以 Docling 文档处理技能到季度供应商对账环境的案例展示蓝图挑战与难度模式的映射;证据为框架描述与案例,而非对照实验。
迭代任务加固(Iterative Task Hardening)用求解器执行证据诊断哪些挑战已被轻松解决,再增强或新增难度模式并同步修订蓝图与环境,使任务逐步变难。 与一次性合成不同,该方法把求解器表现当作难度调节信号,并允许把诊断中新发现的通用挑战抽象回难度模式池,供后续任务设计复用。 在 500 个两轮均被加固的配对任务上,DeepSeek-V4-Flash 在 pi 框架下的满分率从 48.40% 降到 24.80% 再到 15.40%,平均助手轮次从 25.91 升到 36.54 和 38.85;这是配对比较,控制了任务身份。
用 Skill2Env 环境生成的 1.5K 条高分轨迹做监督微调,Qwen3.6-35B-A3B 在七个下游基准上全部提升,未加权平均从 36.6 升到 45.0(+8.4)。 提升并非针对单一基准调优:SkillsBench +14.34、Terminal-Bench 2.1 +13.5、SWE-bench Multilingual +7.7、AutomationBench +7.34、VitaBench +5.87、Claw-Eval +5.51、-Banking +4.47,说明围绕通用能力需求构造的监督可跨领域、跨接口迁移。 主表覆盖七个基准,含闭源前沿模型与开源权重模型对照,并纳入 FACET 作为技能型环境合成基线;微调仅用 1.5K 轨迹、5 个 epoch、全局批大小 32。
加固阶段的任务集合在相同数据预算与质量阈值下提供更好的训练监督:七基准平均分随加固轮次从 40.58 升到 42.51 和 42.87。 这把“任务更难”与“监督更有用”两个问题分开验证,说明加固不只是提高失败率,还改变了可提取训练信号的质量。 每轮用同一 SFT 质量过滤并随机抽取 500 条合格轨迹,固定训练集规模与质量阈值;作者说明因合格轨迹集合随轮次变化而采用随机而非配对抽样。
启示与展望
该框架面向需要工具使用与多步交互的智能体后训练场景,适用于能从公开技能库获得可执行技能、并能在 Linux 沙箱中配置依赖与运行时的团队。它使研究者可以按能力维度而非仅按领域或技能覆盖来设计训练环境,并把求解器表现反馈进任务设计;对希望用少量高质量轨迹提升中小规模智能体通用执行能力的实践者,论文给出的路径是先用技能合成环境、再筛选高分轨迹做监督微调。
论文报告的是单一骨干模型(Qwen3.6-35B-A3B)在固定合成模型与求解器配置下的结果,其他骨干与合成模型组合是否同样受益仍是开放问题;前沿闭源模型在多个基准上仍更强,说明能力上限与剩余空间尚待刻画。加固效果在 500 个配对任务与固定预算的 500 条轨迹上验证,更大规模与更多加固轮次的表现有待观察。此外,本次载入的文本包含摘要、正文、附录与案例,但部分表格与图示内容以文字形式呈现,个别数值细节(如加固触发阈值与学习率的具体取值)在文本中未完整给出,读者若需精确复现应查阅原文。
