跳到主要内容
返回时间线
Hugging Face - Blog来源发表:

ServiceNow CoreAI 的 AutoSynthData 用失败诊断生成企业智能体训练任务,在 EnterpriseOps Gym 上把 Gemma 的 Pass@1 提升 7.2 个百分点

核心概要

ServiceNow CoreAI 提出 AutoSynthData,用目标模型的失败与更强教师的成功来定位能力缺口,据此生成并校验新的可执行任务(系统规范、用户提示、验证器三件套),在 EnterpriseOps Gym 的 Hybrid 域用 Gemma-4-26B-A4B-it 与教师 Qwen3.8-27B 生成 2000 条样本(约 18 小时),微调后最佳检查点(第 5 轮)使平均 Pass@1 提升 7.2 个百分点(相对提升 35%)、验证器成功率从 63.01% 升至 68.55%,并弥合 Gemma 与参考模型之间 59% 的 Pass@1 差距;在 ITSM 域用教师 DeepSeek-V4.1-Flash 生成 1994 条样本(66 小时),平

AI-generated editorial illustration: AutoSynthData: Generating Training Data for Enterprise Agents

深度剖析

把“模型在具体企业环境中的失败”转化为可训练数据:AutoSynthData 先在环境中用诊断任务评测目标模型,同时让更强的教师模型跑同一批任务,据此识别被测能力、涉及的工具有工作流结构、目标模型失败点与教师成功路径、正确终态需满足的性质,以及可在保持能力不变的前提下变化的维度。 相对直接复用评测任务或人工编写任务的做法,这里把评测运行蒸馏为“脱敏的能力规格卡”,生成器只拿到卡片,不接触原始提示、实体、轨迹或验证器细节,因此新任务在提示、状态与解法路径上都与评测集不同。 文中以 EnterpriseOps Gym 的 Hybrid 与 ITSM 两个域的实验说明该流程,并明确说明训练任务是由能力规格新生成的、生成器未获得原始评测任务;但原文未给出规格卡的具体数量或人工审核规模。

给出任务与验证器的质量判据:任务需满足可行性(环境中存在至少一条满足提示且遵守系统规范的轨迹)、真实性(像用户会真实提出的请求)、难度(暴露当前模型的弱点);验证器需满足一致性、可靠性与完备性,即与提示、系统规范和任务状态一致,拒绝失败或违规轨迹,同时接受多种有效解法而非只认一条参考轨迹。 把“生成一个看起来合理的请求”与“生成一条有用的训练样本”区分开,并指出宽松验证器会奖励错误行为、过严验证器会惩罚有效解法,从而把验证器质量直接与训练信号质量挂钩。 这些性质以定义与设计原则的形式给出,并配有正门(参考轨迹能否通过验证器)与负门(对期望结果做变异后是否不再通过)两道检查;原文未报告这两道门各自的通过率或误判率。

两阶段数据构建加双层质量控制:target 阶段并行生成核心样本,每个候选经过验证、执行、求解器评测与修复后才被接受;multiply 阶段对已接受样本生成新变体,每个变体有自己的用户请求、环境状态、实体配置、参考轨迹与验证器,且乘生样本不能再作为种子,以限制跨代漂移。难度上偏好目标模型三次中至多成功一次、更强求解器三次中至少成功两次的任务。 样本级检查用于修复单个候选(失败后经批评者诊断再做定向修复,重试次数有固定上限),批次级 meta-review 用于检查任务族是否过度集中、能力维度是否缺失、是否重复出现同类样例、哪些目标持续生成失败,并由控制器减少过度代表区域的生成、把工作量导向缺口。 流程描述较完整,包含固定的难度筛选阈值与重试上限;但原文未给出被拒绝候选的比例、修复成功率或批次级调整带来的增益。

在两个企业域上验证有效性:Hybrid 域用 Gemma-4-26B-A4B-it 作目标、Qwen3.8-27B 作教师,约 18 小时生成 2000 条样本,微调后最佳检查点为第 5 轮,平均 Pass@1 提升 7.2 个百分点(相对 35%),验证器成功率 63.01%→68.55%,弥合 Gemma 与参考模型 59% 的 Pass@1 差距;ITSM 域用 DeepSeek-V4.1-Flash 作教师,66 小时生成 1994 条样本,平均 Pass@1 从 18.77% 升至 27.18%。 同一套“按失败生成任务”的机制在两个不同域上都带来提升,说明其不依赖单一环境;ITSM 生成更慢,原文归因于使用了更大的教师模型且该次运行早于提升吞吐的流水线优化。 报告了具体样本量、生成时长、最佳轮次与前后指标;实验聚焦 SFT,评估在生成所用的同一环境内进行,原文未报告跨环境迁移或与其它数据合成方法的对照。

启示与展望

该工作面向需要在自有系统、规则与数据状态下工作的企业智能体,适用于具备可执行环境、可回放参考轨迹与确定性验证器的场景,例如 EnterpriseOps Gym 的 Hybrid 与 ITSM 这类有状态企业环境。对读者而言,它提供的是一套可复用的流程:先诊断失败、再蒸馏能力规格、再生成并校验任务、最后用接受样本做后训练,并在模型更新后重新定位剩余缺口。原文说明实验聚焦 SFT,并计划把同一机制扩展到 RL,即生成挑战当前策略的任务、训练、再随策略移动生成目标。

原文未报告质量门的通过率、被拒绝候选比例、修复成功率,也未给出与其它数据合成方法的对照,因此难以判断增益中有多少来自该流程本身。ITSM 生成耗时 66 小时被归因于更大的教师模型与早于吞吐优化,说明生成成本对教师规模与流水线实现敏感。此外,评估在生成所用的同一环境内进行,跨环境迁移、以及 RL 下的移动难度前沿仍是待验证的开放问题。本次读取的文本不完整,缺少图表与附录,因此规格卡的具体形式、批评者与 meta-review 的提示设计等细节无法从现有内容确认。

来源