CompoWorld 用 448 个可复用服务组合出跨服务任务,把 Qwen3.6-35B-A3B 在八个基准上平均提升 9.17 分
核心概要
CompoWorld 提出组合式环境扩展框架:用编码智能体把 MCP 工具规范转成带类型状态与共享接口的可执行服务,用随机游走在服务依赖图上生成并验证跨服务任务,再用验证过的轨迹做 SFT、用 Completion-Focused Rubric Reward 配合 GRPO 做 RL,构建了 448 个服务、10,130 个工具,并用 3K SFT 轨迹与 1K RL 任务训练 Qwen3.6-35B-A3B,在八个基准上平均提升 9.17 分,AutomationBench 任务成功率从 10.33% 升到 32.33%。
深度剖析
框架把环境扩展的维度从“更多环境”转向“环境之间的依赖组合”:每个服务拥有类型化状态、工具集与转移逻辑,组合后的乘积环境保留各服务本地动态,信息通过智能体的观察与后续动作在服务间流动。 此前 AgentScaler、ScaleEnv、Agent-World 等工作主要扩大单一环境或任务集合,AppWorld、Terminal-Universe 则从基准或工作区角度暴露跨应用需求;CompoWorld 把“服务组合”本身做成可控的训练环境生成维度。 论文给出组合环境的 POMDP 形式化定义与乘积环境构造,并说明命名空间用于区分同名工具;这是概念与形式化层面的贡献,配套实现见 448 个服务与 10,130 个工具。
任务生成采用随机游走采样服务并连成服务级依赖图,边表示信息依赖、重访表示前次取值已过期,再由任务生成智能体在 explore、design、probe、submit 四阶段中实例化初始状态、目标与结构化评分标准,并用可执行终态检查验证参考解可达且被接受。 相比固定工具调用序列的合成方式,这里记录的是服务级依赖而非唯一调用顺序,允许其他成功轨迹使用不同工具序列。 论文给出游走长度约束(覆盖全部选中服务、避免连续访问同一服务、至少重访一次)与验证条件,并说明验证器不要求与参考目标状态完全相等;难度主要由游走长度控制,默认组合 5 个服务并加入 5 个干扰服务,游走长度在 7 到 12 之间随机采样。
训练侧用验证过的成功轨迹做 SFT,并提出 Completion-Focused Rubric Reward:按当前 rollout 组内各评分项的通过率反向加权,通过率越低权重越高,再配合 GRPO 归一化得到优势。 均匀评分平均会给已满足的简单条件与未满足的困难条件同等权重,高平均分仍可能意味着用户目标未达成;该奖励把学习信号集中到剩余完成缺口上。 论文给出梯度分析,说明在更新原点处评分项的梯度权重由完成缺口控制,并保留正的下限;附录图 6 显示重加权运行起点较低(约 0.63 对 0.68),约第 50 步反超,第 140 步约为 0.76 对 0.67。
在八个基准上,CompoWorld 相对 Qwen3.6-35B-A3B 平均提升 9.17 分;AutomationBench 成功率从 10.33% 升至 32.33%(+22.00),超过 GPT-5.4(27.67%)与 Claude Opus 4.6(25.50%),接近 DeepSeek-V4-Flash(36.33%),并在该基准上领先全部六个对比的 35B-A3B 专用智能体模型。 论文同时报告 AutomationBench 1.0.6 的分领域部分分:均值从 41.94 升到 72.68,HR 提升最大(+49.40),Marketing(+32.51)与 Sales(+31.45)次之,说明增益跨业务职能而非集中于单一领域。 结果来自论文表 1 与表 2;部分对比模型使用来源报告的结果,缺失或不兼容处以短横线标注。论文也指出 32.33% 的通过率说明完成全部要求仍然困难,VitaBench 2.0 仅提升 1.62 分。
启示与展望
该框架面向需要跨服务信息流动的通用智能体训练,适用于可被建模为带类型状态与工具接口的服务集合,例如邮件、Slack、日历与数据库应用;服务库来自公开 MCP 规范,因此其覆盖范围受这些规范的可获得性影响。对无法可靠实现为确定性本地代码的工具,论文用世界模型做选择性模拟,并说明只有少量工具依赖模拟、只有约少量样本会调用这类工具,从而把模拟误差限制在训练语料的一小部分。环境扩展实验显示,仅用 100 条 SFT 样本即可在四个基准上超过骨干模型,3K 时 -Banking 从 10.65 升到 17.87、DeepPlanning 从 26.04 升到 35.02;在固定数据预算与相同环境数量下,组合环境训练在四个对比中均优于单环境训练,例如 AutomationBench 从 12.83 升到 33.33。这些结果适用于希望用可复用服务组合来扩大训练数据多样性与结构复杂度的团队。
论文指出,自动生成的测试无法覆盖真实服务的全部业务规则、隐式依赖与罕见边界情况,当前编码智能体尚不能完全解决这一点;世界模型模拟虽只覆盖少量工具与样本,但一旦产生不准确观察,仍可能影响智能体后续判断。RL 的效果并不一致:论文报告 RL 相对 SFT 在八个基准上平均提升 1.2 分,SkillsBench 提升明显,而 -Banking 略有下降,整体改进主要由 SFT 驱动。环境质量主要通过下游训练增益间接评估,而非逐个环境直接验证。此外,部分对比模型使用来源报告的结果,缺失或不兼容项以短横线标注,读者在横向比较时需留意这一口径差异。Sales 仍是分领域得分最低的一项(58.93),论文认为这些工作流中的依赖与约束仍有加强空间。
