多智能体系统在代码生成、招聘与同行评审中出现同质化,采样随机性与混合模型配置均未能缓解
核心概要
该研究将多智能体系统中的同质化操作化为从众、极化与惯性三项指标,在代码生成、招聘与同行评审三类任务上评估,发现智能体交互会降低多样性并放大共享失败,且采样随机性与混合模型配置都无法缓解这些风险。
Figure 1 : Homogenization in MAS and the resulting failure modes.
arXiv深度剖析
论文提出并验证了同质化是多智能体系统的一种失败模式,用从众(智能体分数方差随轮次下降)、极化(系统均值向量表端点漂移)与惯性(均值变化速率逐轮下降)三项指标刻画。 此前关于同质化的研究多把模型视为孤立决策者,或聚焦于主观话题辩论、游戏等任务;该工作把同质化操作化并扩展到真实多智能体应用,且惯性指标为作者自行引入。 三项指标在编排器驱动的多智能体系统上定义,并在代码生成、招聘、同行评审三类任务、多个模型与多种混合配置下测量,报告为跨独立随机种子试验的均值与置信区间。
在代码生成中,多智能体系统虽整体降低安全漏洞率,但同质化导致相关错误被放大,形成系统性安全盲点,且这些盲点跨模型家族共享。 以往评估多关注聚合性能提升;该工作按漏洞类型分解并在可部署性条件下分析,显示部分漏洞(如 py/url-redirection、py/log-injection)在多轮交互中持续甚至放大。 在 CodeLMSec 数据集的 280 条 Python 与 C++ 提示上,用 CodeQL 安全查询套件检测漏洞,并按评审面板平均可部署性分数过滤,以隔离逃过整个系统的缺陷。
在招聘中,单个智能体注入的刻板偏见会迅速传播到整个评审面板,并在该偏见智能体被移除后仍然持续,说明系统对操纵高度敏感。 以往工作多关注静态偏见测量;该工作通过仅在两轮内注入对抗指令,展示偏见的跨智能体传播与移除后的残留效应。 使用按 Tan 等(2026)方法构建的合成反事实简历数据集,覆盖不同性别与族裔变体,并独立评估每个反事实变体,以分数差异量化人口统计偏见。
在同行评审中,同质化推动评审分数向收敛偏好演化,使不同研究领域之间的评分差距随交互轮次扩大。 以往对自动化评审的评估多关注与人类评审的一致性;该工作显示多智能体交互会把潜在模型偏好固化为跨学科的系统性差异。 采用 Sahu 等(2025)的多智能体结构(三名评审、一名元评审、一名作者),对 ICLR 2025 投稿按作者自选主领域分层抽样,并按领域汇总平均评审分数与分布跨度。
启示与展望
该工作面向使用编排器驱动架构的多智能体系统研究者与部署者,适用于代码生成、招聘与同行评审这三类需要多角色协作的任务。其价值在于提供一套可复用的三项指标,用于在部署前审计交互动态,而不是仅看聚合性能;对计划把多智能体评审或筛选流程投入实际使用的团队,结果提示需要把跨轮次的分数方差、均值漂移与变化速率纳入监控。
读者仍需关注:同质化的度量基于智能体输出的数值分数,自然语言层面的同质化尚未量化;实验限于编排器驱动的多智能体架构,其他架构下的表现有待检验;招聘评估使用合成反事实简历,其人口统计信号由 Gemini 3.1 Pro 验证可被识别,但与真实简历的差距需要进一步观察;同行评审样本来自 ICLR 2025 的特定分层抽样。此外,正文中部分具体数值(如漏洞率下降幅度、极化点数、轮次间变化幅度)在提供的文本中被省略,若需精确效应量应查阅原文图表。
