50个无状态LLM智能体在局部可见同伴下更新预测,研究识别出同步、扭曲与嵌合三类集体状态,并发现推理努力与通信拓扑分别控制协调的不同方面
核心概要
该研究让N=50个无状态LLM智能体仅根据局部可见同伴更新预测,并用全局与局部一致性度量刻画其行为,识别出同步、扭曲(局部有序但全局不一致)和嵌合(一致与不一致子群共存)三种集体状态;提高gpt-5-mini的推理努力会把面板从多变、常碎片化的结果推向局部有序的扭曲状态,而提高通信连通性则推动其走向全局同步,且低空间异质性并不保证全局共识——在Delta Z低于0.03的试验中仍有40%在最后20轮保持扭曲构型。
Figure 1: Reasoning-effort intervention in the clock task. Trial-level spatial heterogeneity Δ Z \Delta Z is shown on a logarithmic axis; higher-effort panels remain twisted rather than globally synchronised.
arXiv深度剖析
研究提出并区分了多智能体LLM面板中的三种集体状态:同步、扭曲(局部有序但全局不一致)和嵌合(一致与不一致子群共存)。 以往工作主要通过最终准确率或总体一致性来评估多智能体LLM系统,这些指标无法揭示一致性在面板中是如何组织的;本文同时使用全局与局部一致性度量来刻画集体行为。 基于N=50个无状态LLM智能体、仅从局部可见同伴更新预测的设定,通过全局与局部一致性测量识别出三类状态。
提高gpt-5-mini的推理努力会使面板从多变、常碎片化的结果转向局部有序的扭曲状态,而提高通信连通性则推动面板走向全局同步。 这表明推理努力与通信拓扑控制的是多智能体协调的不同方面,而非同一维度上的强弱变化。 在gpt-5-mini上观察到推理努力带来的状态转变;通信连通性增加带来全局同步;碎片化随重连图中代数连通性增加而更快崩溃。
拓扑效应也出现在非循环评判任务上,并跨越来自三个提供方的模型。 说明该效应不局限于单一任务结构或单一模型家族,具有跨任务与跨模型的适用性。 在非循环评判任务以及来自三个提供方的模型上均观察到拓扑效应。
低空间异质性并不保证全局共识:在Delta Z低于0.03的试验中,40%在最后20轮仍保持扭曲构型。 直接挑战了以总体一致性或低异质性推断共识的常见做法,说明总体一致性不足以刻画集体LLM行为。 在Delta Z低于0.03的试验中,40%在最后20轮保持扭曲构型;另有一项小型后续实验显示,这类状态也可从置换初始条件形成。
启示与展望
该研究面向使用多智能体LLM进行审议与评估的场景,适用于智能体仅从局部可见同伴更新预测、且以全局与局部一致性度量刻画集体行为的设定;其结论在非循环评判任务与来自三个提供方的模型上得到复现,说明拓扑效应不限于单一任务结构或单一模型家族。对系统设计者而言,这意味着推理努力与通信拓扑可作为两个可分别调节的杠杆:前者影响面板是否走向局部有序的扭曲状态,后者影响是否走向全局同步;碎片化随重连图中代数连通性增加而更快崩溃,也为通过图结构调控收敛速度提供了依据。
读者仍需关注:扭曲状态在置换初始条件下形成的小型后续实验规模有限,其可重复性有待更大规模验证;低空间异质性与扭曲构型长期共存(Delta Z低于0.03的试验中40%在最后20轮保持扭曲)提示以总体一致性作为收敛判据可能掩盖局部结构,但这一现象在不同任务与模型上的普遍程度仍需进一步刻画;此外,推理努力与通信拓扑的交互作用、以及代数连通性与碎片化崩溃速度之间的定量关系,仍是值得追踪的开放问题。
