AgentWorld 用 100 个 MMORPG 长程任务测多智能体协作:最强模型成功率仅 52.0%,CCE 只有 0.320
核心概要
研究者构建了 AgentWorld——一个基于开源 MMORPG 引擎 Kaetram 的 100 个人工标注任务(另有 100 个 LLM 增强变体)基准,要求 3–20 个角色不对称的智能体在 25–55 轮黑箱条件下协作,并提出基于因果动作图的 Causal Collaboration Effectiveness(CCE)指标;在 Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini 和 DeepSeek R1-70B 上测试,最佳模型任务成功率仅 52.0%、CCE 仅 0.320,失败模式集中在沟通中断、角色混淆和无法跨轮维持共享计划。
深度剖析
提出面向长程黑箱协作的基准 AgentWorld:100 个人工标注任务加 100 个 LLM 增强变体,覆盖战斗、制作、采集、交易、探索、生存、建造、协调 8 类,任务跨度 25–55 轮、需要 3–20 个角色不对称的智能体。 论文指出既有基准多为竞争性设置、20 步以内的短程交互,或只是把个体表现简单加总,难以隔离真正的协作能力;AgentWorld 通过 13 个高层 API 工具把底层操作(寻路、战斗、采集)封装成单次调用,使分数反映协作而非操作熟练度。 任务由 5 名标注者按预设类别分布设计,每个任务配有 Python 验证器,并经两个 LLM 的试点实验迭代,直到失败只剩智能体错误;轮次预算由试点运行校准。
提出 Causal Collaboration Effectiveness(CCE):在任务轨迹上构建因果动作图,从成功动作向后逐轮回溯,用 LLM 做二值因果判断,计算贡献动作占全部动作的比例。 论文认为成功率无法区分“一个智能体干完所有活、其他人闲置”的成功,而整体打分的 LLM-as-judge 主观且随裁判模型更新而漂移;CCE 把裁判角色压缩为客观的二值因果判断。 在 84 条人工标注的动作—贡献判断上,人类标注者与 GPT-4.1 裁判一致 69 条(82% 原始一致率,Cohen's κ = 0.64);换用 Claude Sonnet 4 重算,动作级一致率为 84%(7,298 次判断)。用 GPT-4.1、Claude Sonnet 4、Llama-4 Maverick 三个裁判重算,模型相对排序完全保持,绝对值变动不超过 0.05。
四个前沿模型的表现显示协作仍是共同短板:主集上 Gemini 3 Flash 成功率最高 52.0%,其后是 Claude Haiku 4.5(45.0%)、GPT-5 Mini(36.0%)、DeepSeek R1-70B(20.0%);最佳模型的 CCE 仅 0.320,即不到三分之一的动作真正促成结果。 论文把“沟通量不等于协作质量”作为实证发现:GPT-5 Mini 每任务发消息最多(44.1 条)但成功率排第三,DeepSeek 发得最少(7.5 条)且排最后,Gemini 沟通适中(11.0 条)却成功率最高;在成功任务上 Claude 的每任务协作效率最高(0.653,Gemini 为 0.609)。 四个模型使用完全相同的系统提示、用户提示模板和 API 工具定义;主集与增强集各 100 个任务;增强集上所有模型成功率大幅下降(Gemini 52%→24%,Claude 45%→26%,GPT-5 36%→21%,DeepSeek 20%→10%)。
消融与基线刻画了难度来源:随机动作仅解 5.7%,单智能体基线 28.6%,无沟通 22.9%,共享计划但无沟通反而更低(17.6%),oracle 沟通提升到 60.0%;去掉任务文档(54.3%→29.4%)和把轮次预算从 50 缩到 10(54.3%→37.1%)造成最大跌幅。 论文用这些对照说明任务确实需要多个协调的智能体,且计划的价值取决于执行中能否修订;即便有 oracle 沟通仍有 40% 失败,说明相当一部分难度来自长程规划与资源分配本身。 消融在 35 个任务的子集上进行;Gemini 3 Flash 在温度 0.7、种子 42/819/314 下三次运行成功率均为 54.3%(样本标准差 0.0 个百分点),轮次标准差 2.07、消息标准差 0.18。
启示与展望
这项工作面向需要评测 LLM 智能体团队协作能力的研究者与工程团队,适用场景是黑箱、角色不对称、25–55 轮的长程协作任务;沙箱、任务定义与验证器、评测脚本和标注平台全部开源,可直接复用或扩展。CCE 采用有意宽松的标注策略,边际有帮助的动作也计入贡献,因此论文建议把 CCE 读作真正有用动作比例的上界。
CCE 仍依赖 LLM 做底层因果判断,论文用人类一致性与三个裁判模型的排序稳定性来支撑其可靠性,但绝对值会随裁判变化(如 Claude Haiku 在 GPT-4.1 与 Claude Sonnet 4 之间从 0.294 变到 0.241)。三次重复运行只覆盖单一模型和 35 个任务的子集,论文明确说明这不足以确立跨模型的稳定性或模型间差异的统计显著性。增强变体由 Claude Opus 生成,人类只抽样验证了 10%,其中难度合适性为 90%。沟通失败模式分析基于 Gemini 3 Flash 在 100 个任务轨迹中的 61 条错误消息,属于定性观察。此外,本次读取的是论文全文的文本内容,图表以文字描述形式呈现,具体图形细节未直接可见。
