跳到主要内容
返回时间线
arXiv来源发表:

多智能体协作的全局一致性:局部智能无法替代缺失的全局状态

相关研究与后续进展

核心概要

该工作提出全局一致性问题,即每个智能体做出局部有效决策却共同产生无效结果,并给出观测别名不可能性定理:当k个不可区分世界需要两两不相交的动作时,最佳随机化最坏情况成功率为1/k;随后提出局部到全局运行时语义X=(H,C,G,F;D),由harness掌管共享状态与提交,九项研究显示隐藏关键事件时前沿模型得分12–17/40(接近1/3随机水平),恢复一个权威事实后回到40/40,TeamBench中提交强制执行将违规从5/5降至0/5,tau2-bench Telecom中harness得分1.00而当前状态检查仅0.07。

Source-provided article image: Global Coherence: When Every Agent Is Right and the Team Is Still Wrong - A Local-to-Global Semantic Foundation for Multi-Agent Collaboration
Figure 2 ·

Figure 2 shows all five on one example: a Design agent, a Fabrication agent, and a Cost agent share one beam, and each records its length in its own unit.

arXiv · 第 3 页

深度剖析

论文将多智能体失败重新定义为全局一致性问题,即共享状态的失败而非模型智能的失败,并给出观测别名不可能性定理刻画其精确边界:策略能保证有效动作,当且仅当产生同一观测的所有世界共享一个可采纳动作。 相对于把协作失败归因于推理能力或通信不足的常见视角,该定理指出当k个不可区分世界需要两两不相交动作时,最佳随机化最坏情况成功率为1/k,更多推理、角色、消息或采样都无法恢复缺失的区分。 该边界以定理形式给出,并在受控修订基准上得到检验:同一前沿模型在决定事件可见时得40/40,隐藏时测试组得12–17/40,与1/3随机水平一致,恢复一个权威事实后回到40/40。

论文提出局部到全局运行时语义X=(H,C,G,F;D):拓扑H记录重叠作用域,范畴C管理改变状态的动作,群胚G保留可逆转换,层F检验局部视图能否粘合为单一世界,最小历史D只保留改变合法未来的区分;模型负责提议,harness拥有共享状态并管理提交。 该框架把共享状态的所有权与提交权从模型转移到harness,为多智能体协作提供可执行的运行时语义,而不仅是概念上的协调建议。 九项研究同时检验失败与其边界:TeamBench中普通团队5/5次超出共享预算,可见实时计数仍有4/5次违规,提交强制执行后为0/5;tau2-bench Telecom中静默回退后当前状态检查得0.07,而harness得1.00。

论文报告了一个反直觉结论:局部智能无法替代缺失的全局状态;当传统求解器已经拥有完整相关状态时,它与harness打平,符合预测。 这一结果把harness的收益定位在缺失全局状态的情形,而非普遍优于传统求解器,为判断何时需要该框架提供了边界条件。 该结论来自九项研究的对照设置,包括受控修订基准、TeamBench与tau2-bench Telecom,以及传统求解器已拥有完整状态时的打平结果。

启示与展望

该工作面向具有重叠作用域、需要共享状态的多智能体运行时,适用于模型负责提议、harness拥有共享状态并管理提交的设置。它使团队能够在关键事件被隐藏或静默回退发生时仍保持全局一致,受益者包括构建多智能体协作系统的研究者与工程师。当传统求解器已经拥有完整相关状态时,harness不再带来额外优势,这一条件界定了结果的适用范围。

读者仍需关注:观测别名不可能性定理的1/k边界在何种观测结构下最常出现;harness的提交强制执行在更长时程与更大团队规模下的表现;以及传统求解器已拥有完整相关状态时的打平条件在更多任务中的普遍性。本次读取范围为摘要,未包含图表与完整实验细节,因此具体实现与统计细节仍需查阅原文。

来源