跳到主要内容
返回时间线
arXiv来源发表:

Raven 用可组合的模型—执行框架单元,在 MAOB 规划、四个专家域与技能复用上同时超过 Claude Code 等基线

核心概要

Raven 是一个开源多智能体生态,把每个可执行的模型—执行框架(harness)对当作可组合的智能单元,由 Host Agent 把目标拆成有向无环图并匹配专家、用 HarnessBank 式进化与 EverOS 记忆和 Skill Forge 复用经验,理论上给出在共享资源预算下组合能扩展可靠任务覆盖的充分条件,并在 MAOB 规划基准、四个原生专家域、冻结骨干的 harness 进化以及固定技能库复用上报告了优于 Claude Code、Hermes Agent、OpenClaw 等基线的结果。

AI-generated editorial illustration: Raven: The Harness of Harnesses for Composable Agentic Intelligence

深度剖析

Raven 把编排从“为单一领域造一个更强 harness”转为“自动构造、按经验改进并跨域编排专用 harness”,每个可执行模型—harness 对被视为一个可组合的智能单元,Host Agent 负责分解目标、匹配子任务到注册的专家、以有向无环图表达依赖并整合结果。 相对以对话或固定角色流程组织协作的多智能体框架(如 AutoGen、MetaGPT),Raven 通过执行适配器接入 Claude Code、Codex、Hermes Agent、OpenClaw 等异构 harness,并在派发前对图做格式、结构、能力、状态与环境五组校验,使异构执行能力可以按显式依赖组合。 论文给出系统架构、注册表与准入校验规则、节点生命周期与完成判定流程,并说明 Host Agent 依据能力标签选择执行者而不依赖单独训练的路由分类器;这些是设计层面的证据,端到端收益由后续各节实验分别评估。

论文给出可组合智能的理论刻画:在固定任务族与共享资源预算下,把能力定义为带预算的可靠任务覆盖,并给出互补的局部能力、兼容的交接以及有界的规划与执行误差足以让组合系统解决单个可用智能体在同等预算下无法可靠解决的任务的充分条件。 相对以往只报告平均成功率或路由效果的工作,这里把规划、协调、交接与重试成本一并计入预算,并用显式互补构造(两个各只能读取一个比特的智能体加一个可计算奇偶性的节点)说明组合可带来新的任务覆盖。 结论以定理、命题与推论形式给出,并明确是充分条件、依赖所实现的智能体与 Host 是否满足前提;作者同时指出该结果不蕴含严格集合包含或平均性能提升,需要与具备同等模型、工具、初始信息和总成本的强单体基线做匹配比较。

在自建的 Multi-Agent Orchestration Benchmark(MAOB)上,Raven 在两个骨干下于全部四项图指标上排名第一,Exact Match 相对最强基线分别提升若干个百分点,且 Edge F1 在所有系统下都低于 Node F1,说明依赖关系预测比专家选择更难。 MAOB 先固定参考 DAG 再反向生成请求,并用泄漏过滤剔除显式步骤枚举与直接点名领域的请求,从而在派发 worker 之前单独测量专家选择与依赖预测,而不是把规划错误与执行质量混在端到端准确率里。 基准包含 140 个任务,覆盖四专家名册下全部 11 种至少两域的域组合,参考图平均含若干节点与边;三个系统在相同请求文本、相同委派指令与相同骨干下比较,规划阶段不派发 worker。

四个原生专家与复用机制分别报告了收益:Raven-Research 在三个共享骨干上取得最高合并准确率,Raven-Code 在八个设置中的六个取得最高分并在整仓库迁移上领先,Raven-Design 在全部六个基准与骨干组合上得分最高,Raven-Oncall 在 autoresearch 上以更低 token 与成本取得更低 BPB,固定技能库在全部十二个单元—基准比较中提升表现且 Raven 的增益大于 OpenClaw。 这些评估把编排、harness 进化、专家执行与技能复用作为不同能力层级分别测量,并保持骨干与 harness 固定以隔离被考察的组件;harness 进化沿用已发表的 HarnessBank 实验,技能复用沿用已发表的 SkillCorpus 实验。 报告了具体数值与统计支持,例如冻结 Qwen3.6-27B 骨干下 AppWorld 提升 15.4 个百分点、BrowseComp+ 13.9、LiveCodeBench 13.7,六项比较通过配对增益判据;技能复用给出 SkillsBench、GDPval、QwenClawBench 的合并增益与 z 值,并说明 GDPval 上各单元增益在 20 至 27 点的每题奖励标准差下不具统计可区分性。

启示与展望

这项工作面向需要长时程、跨域协作的智能体系统构建者:它给出了一套可运行的编排、进化、记忆与技能复用机制,以及在这些机制下何时组合能扩展可靠任务覆盖的充分条件。适用场景是拥有多个异构 harness、愿意为规划、校验、交接与重试支付显式预算的部署;MAOB 的结论限于四专家名册与所测工具配置,理论结论以所实现智能体与 Host 满足前提为条件。对读者而言,可直接复用的是把模型—harness 对当作组合单元、在派发前校验依赖图、把记忆记录与图边分开、把技能选择与工具权限分开这几条设计原则。

理论结论是充分条件,其实际适用性取决于所实现的智能体与 Host 是否满足兼容性、契约实现与误差界等前提,论文本身也指出这不蕴含严格集合包含或平均性能提升。评估方面,MAOB 的参考图由模型撰写并经人工复核,泄漏过滤只能排除显式规划线索,无法排除改写后的暗示;GDPval 上各单元的增益在较大每题奖励标准差下不具统计可区分性,SWE-bench Verified 的 26 题测试集也未通过配对增益判据;共享组记忆默认关闭且未在本报告中评估,其编排与任务表现影响仍待建立。此外,本次读取的文本在若干处出现数值空缺(如 MAOB 的 Exact Match 百分点差、部分表格单元格),因此这些具体数字无法在此复述,需要回到原文核对。

来源