Relic 把反复出现的协作失败变成可执行协议,360 次受控运行把完整合同交付从 14.06% 提到 19.76%
核心概要
Relic 让多智能体组织把反复出现的协作失败转化为组织所有、可执行且可修订的协议,在 360 次受控运行(十个软件工作负载、三个模型)中把主线上的完整合同交付率从 14.06% 提升到 19.76%(+5.71 个百分点),并在新成员迁移下把行为正确率从无继承协议的 25.4%、纯文本规则的 34.6% 提升到可执行绑定的 41.2%。
深度剖析
论文把“组织能力”形式化为成员本地状态之外的学习所得、受治理、可执行的协议状态,协议绑定触发条件、责任角色、所需证据与执行后果,并可修订与退役。 此前的工作(ChatDev、MetaGPT、AutoGen 的对话与工作流,Reflexion、ExpeL、G-Memory 的记忆,Voyager 的可执行技能)保留知识或流程,但一次对话达成的约定不会自动约束接替该角色的新成员;Relic 把约定变成对角色而非对个人的义务。 论文给出形式化定义(组织状态 O_t=(W_t,Q_t,R_t))与治理流程(提案、验证、批准、编译绑定、修订、退役),并在一个被追踪的案例中展示接口评审规则从提出到执行、再到两次修订的完整生命周期。
在 360 次受控运行中,启用协议生命周期的 B3 相对共享同一 SDL 骨干但关闭该生命周期的 B2,在四个已验证端点上全部提升:完整合同 +5.71 个百分点(95% CI [2.97, 8.55]),留出用例 +7.72,公开用例 +6.58,评估者确认的种子问题 +6.96。 B2 与 B3 共享模型、工具、任务可见信息、SDL 参数、成员学习与执行代码,唯一开关是受治理的协议生命周期,因此差异可归因于该机制而非更强的模型或脚手架。 三个模型(GPT-5.6 Terra、Claude Opus 4.6、DeepSeek-V4-Flash)各十个工作负载、三个种子,共 360 次运行;每个模型分层中四个端点的 B3−B2 点估计均为正,留一工作负载分析中三个端点全部保持为正。
可执行绑定本身带来增益:在规则创建过程中,去掉绑定的纯文本变体 B3-text 在完整合同上低 7.18 个百分点(95% CI [+3.54, +10.91]);在内容匹配的新成员迁移中,可执行绑定比同样的可读文本高 6.5 个百分点(95% CI [0.7, 15.6]),比无继承协议高 15.8 个百分点。 Text 与 Exec 使用同一份冻结规则内容、同样的措辞与顺序,唯一差别是是否编译为运行时绑定,因此把“可读规则”与“可执行组织绑定”的价值分离开来。 B3 与 B3-text 为 30 次匹配的 Claude Opus 4.6 运行;Text/Exec 各 30 次 GPT-5.6 Terra 运行,Fresh 复用对应的 30 次 B2 主研究运行。
外部基准显示可移植性:CooperBench 全基准上 Relic 达到 367/477(76.9%),高于最强已发布同伴参考 282/477(59.1%)与最强层级 Team 参考 354/477(74.2%);在固定 48 对同模型子集上 Relic 为 29/48,超过 Solo 的 26/48,而官方 Peer 基线为 13/48;ProgramBench 上冻结协议包把 mini-SWE-agent 的平均行为通过率从 64.164% 提到 70.916%。 这些结果把协议层从自建工作负载扩展到外部软件基准,并显示在无固定领导的同伴结构中也能改善协调。 CooperBench 结果在排除损坏基准对后、对所有被比较系统使用同一排除集;ProgramBench 使用同一 25 个任务、无 SDL 的固定协议包。
启示与展望
这项工作面向软件生产场景:十个冻结工作负载(五个从骨架构建、五个在冻结仓库版本上修复或扩展)、336 步调度视野、三个模型。它支持两种部署模式——在工作过程中自适应形成规则,或在初始化时复用已冻结的规则包。对读者而言,可直接使用的部分是把反复出现的协作摩擦写成带触发条件、责任角色、所需证据与执行后果的规则,并让这些规则在成员更替后仍然生效;迁移实验表明,把同样的规则编译为运行时绑定比只提供可读文本更有效。
协议质量、修订与退役如何随时间演化,论文将其列为开放方向;评估集中在软件生产,其他领域、选择性迁移与遗忘、规则质量诊断、替代决策层以及人机组织交互仍待研究。此外,本次读取的是论文正文与附录文本,图表以文字描述形式呈现,若需核对具体曲线形状或逐项数值,仍需回到原始图表。
