跳到主要内容
返回时间线
arXiv来源发表:

给多智能体系统贴上模型家族标签后,群体沿标签分裂,决策轮次与token消耗上升、成功率从96%降至81%

核心概要

该研究在两种无利害关系的合作博弈(Leader Election、Exclusion)和GPQA-Diamond推理基准上,用9至25个来自最多五个开源权重模型家族的智能体做实验,发现当智能体知道彼此所属的模型家族时,交互图会沿该标签分裂成派系(factionalism),且这种分裂跟随被展示的标签而非真实架构——打乱标签或换成中性颜色标签仍会分裂,去掉标签则消失;在严格合作任务中,带标签的群体平均多花30%轮次和55%的token才达成决定,成功率从96%降到81%。

AI-generated editorial illustration: Prompted Identity Degrades Cooperation in Multi-Agent LLM Systems

深度剖析

论文识别并定义了异构LLM群体中的“派系主义”(factionalism):智能体倾向于按共享身份组织成群体,表现为交互图按身份标签分裂,其下是同类偏好(homophily)。 此前关于LLM身份线索的工作多集中在单智能体评判中的自我偏好,或辩论中自我与他人答案归属的差异;本文把问题放到异构多智能体群体的交互结构上,并指出群体线索不是人类社会身份或实验强加的团队身份,而是异构LLM系统中常见的模型家族元数据。 在两种合作博弈和GPQA-Diamond上测量,智能体规模9至25个,来自最多五个开源权重模型家族;用EDR衡量同类偏好、用Louvain社区检测加AMI衡量社区结构,并规定四项检验(两项EDR、两项AMI)经Holm–Bonferroni校正后全部通过才判定为派系主义。

派系分裂跟随被展示的标签,而不是底层架构:在mislabeled条件下打乱标签,分裂仍沿被展示的标签出现;换成中性颜色标签(teal、coral、silver、violet、maroon)后同样出现;不展示任何身份元数据时该行为消失。 作者设计了保持模型固定、只打乱展示标签的反事实实验,并加入中性颜色条件,从而把效应与架构特有的写作风格以及模型名称的语义/声誉联想区分开;作者还报告在mislabeled下,真实家族分区只在两个不平衡实验中满足判定标准,且这可由标签数量约束造成的分区重叠解释。 所有labeled或mislabeled实验都满足派系主义判定标准,所有unlabeled实验都不满足;风格探针显示同类风格相似度差距很小(至多nats/char)且跟随真实架构,而采纳分数在labeled下差距变大、在mislabeled下跟随被展示标签;去掉Gemma的名单(3家族用GPT-OSS、Nemotron、Qwen;4家族用Seed-OSS替换Gemma)复现了同样模式。

展示身份标签会带来可测量的代价:在严格合作任务中,带标签群体平均多花30%轮次和55%的token才达成决定,成功率从96%降到81%;代价随名单规模增大而上升。 此前工作多评估多智能体系统的总体任务表现或运行级失败模式,本文把“智能体被告知彼此身份”这一配置细节与轮次、token和成功率等下游结果直接联系起来,并给出按名单规模分别拟合的广义线性模型估计。 每个任务和名单规模拟合一个广义线性模型,轮次与token用Gamma分布、成功率用二项分布,并纳入名单平衡协变量;Leader Election成功率比值随名单从3增至5家族由降至,Exclusion由降至;带标签群体每成功一次所付token上升倍数在至之间;在Exclusion的5家族设置下,带标签或mislabeled运行无一在时限内收敛,而8%的unlabeled运行收敛。

一个直接的缓解办法是不向智能体暴露身份标签:提供者与模型元数据可以保留在编排器一侧用于路由、校准、调试和问责,而不进入智能体的交互上下文。 作者把这一设计含义作为结论提出,并强调异构智能体系统中的合作在一定程度上是架构选择——通过控制智能体能看到哪些身份,可以在保留多样性的同时不把它变成分裂。 依据是unlabeled条件下所有实验均未出现派系主义,且带标签条件在轮次、token和成功率上均更差;作者同时说明其结论范围限于最多五个开源权重模型家族、受控的纯文本共识博弈,以及四家族在统一采样参数下的复核。

启示与展望

该结果面向构建异构多智能体系统的工程与研究人员:在受控的纯文本共识博弈中,把身份标签从智能体可见上下文中移除即可抑制派系主义,而提供者与模型元数据仍可由编排器保留用于路由、校准、调试与问责。测量框架只使用每轮承诺与收件人选择,因此适用于任何记录交互轨迹的带标签多智能体系统。作者明确把结论限定在最多五个开源权重模型家族、受控的纯文本共识博弈,以及四家族在统一采样参数下的复核;GPQA-Diamond展示了在有客观正确答案的基准上同样存在标签引发的协调代价,但使用的是Leader Election交互协议。

更大的名单规模、闭源模型、其他解码配置以及更丰富的智能体工作流尚未测试;由于没有现成基准同时满足“无利害关系”和评估要求,作者自行设计了协调博弈,因此这些代价能否推广到其他外部评估任务仍是开放问题。此外,本文所依据的文本中部分表格数值在呈现时缺失,具体EDR、AMI与逐家族采纳差距的数值需查阅原文附录表格;在Exclusion的5家族设置下带标签运行无一收敛,该单元格的轮次与成功率未被估计。

来源