MeshHeal 用双时间尺度同伴评审在 BBH、MATH、MMLU-Pro 上以每任务 51k token 达到 0.839 降级期准确率,优于 Symphony 的 0.807(115k token)
核心概要
该工作提出 MeshHeal,一个完全去中心化的自愈框架,通过跨两个时间尺度的能力匹配同伴评审来应对去中心化 LLM 多智能体系统中的灰色故障:在快时间尺度上,自适应层级将不确定或低分输出从重复单评审者评估升级到委员会审议并在使用前纠正;在慢时间尺度上,任务与能力条件的同伴相对检测器聚合分数以区分持续退化与普通输出波动,触发强制委员会评审并最终将退化智能体排除出常规路由,恢复探针为其重新加入提供新证据;作者同时提出 Model-Backed MAS Evaluation 将能力分配绑定到执行模型,并在 BBH、MATH、MMLU-Pro 上报告 MeshHeal 在降级期达到 0.839 准确率、每任务共 51k 模型 to
Figure 1: Overview of MeshHeal . (a) Agents route and complete complementary work. (b) Review by agents with the relevant ability either keeps or replaces the current output, while scores accumulated across tasks update routing eligibility and probes allow recovered agents to return. (c) Model-Backed MAS Evaluation ties execution models to declared abilities and the agent’s healthy or degraded condition, making routing errors affect accuracy.
arXiv深度剖析
MeshHeal 是一个完全去中心化的自愈框架,针对的是智能体保持响应但任务求解质量持续下降的灰色故障。 既有工作通常关注显式失效或集中式协调,而该框架把保护当前任务与调整未来路由分开处理,并允许恢复的智能体重新加入。 摘要以框架描述和跨 BBH、MATH、MMLU-Pro 的评估结果支撑,报告降级期准确率 0.839 与每任务 51k 模型 token。
快时间尺度采用自适应层级,将不确定或低分输出从重复单评审者评估升级到委员会审议,必要时在使用前纠正。 把评审强度与输出不确定性挂钩,而不是对所有输出采用固定评审流程。 摘要给出机制描述,并说明该机制在降级期评估中与整体准确率结果一同被检验。
慢时间尺度使用任务与能力条件的同伴相对检测器聚合分数,区分持续退化与普通输出波动,触发强制委员会评审并最终将退化智能体排除出常规路由,恢复探针提供重新加入的证据。 把退化判定建立在同伴相对、任务与能力条件的聚合之上,并配套恢复探针,使排除不是永久性的。 摘要报告在交错退化与恢复下,MeshHeal 隔离退化智能体、将其排除在常规任务执行之外直至恢复,并使其回归正常路由。
作者提出 Model-Backed MAS Evaluation,将能力分配绑定到执行模型,因为仅基于提示的能力分配可能掩盖路由错误。 针对多智能体路由评估中能力分配与执行模型脱节的问题,提供一种更贴近执行的评估设定。 摘要说明该评估设定用于忠实评估路由,并在 BBH、MATH、MMLU-Pro 上给出与基线对比的准确率和 token 消耗。
启示与展望
该结果面向去中心化 LLM 多智能体网络这一设定,适用于智能体通过本地交互协调、且可能出现响应正常但质量持续下降的场景。它使系统能够在证据尚不足以改变未来路由时先保护当前任务,并在退化被确认后把相关智能体排除出常规路由,同时通过恢复探针让恢复的智能体重新加入。对构建或运维此类系统的人而言,可直接借鉴的是快慢两个时间尺度的分工、能力匹配的同伴评审,以及把能力分配绑定到执行模型的评估方式。
摘要报告了降级期准确率与每任务 token 消耗,但未说明各数据集的分别表现、退化检测的误报与漏报情况、恢复探针的触发条件,以及交错退化与恢复实验的规模。读者若关心这些机制在自身系统中的稳定性,仍需查看正文中的实验设置与消融结果。此外,摘要未给出与更多基线或更大规模智能体网络的对比,因此该框架在更复杂拓扑下的表现仍是开放问题。
