给LLM智能体一个代价,群体偏袒就从标签转向历史:3.3百万次调用显示这是对已观察规范的从众
核心概要
研究让十五个OpenAI模型与三个Claude模型在任意标签的小型社会中玩十轮分点游戏,再以每次只改变一个条件的单次决策测试其群体偏袒。结果:无代价分配中裸标签带来6–9分偏袒,一旦可自留点数即降至约2分;此时历史成为主要来源,在13/15模型上为正、11个模型达3.5–8分并可迁移到陌生同标签者;脚本化历史下平等规范使偏袒归零、反规范使其反转,较强模型在个体记录与群体冲突时站在个体一边。
Figure 1: (a, b) Cue effect and Δ hist \Delta_{\mathrm{hist}} per model, costless (hollow) vs. stake (filled) task. (c) Δ hist \Delta_{\mathrm{hist}} against formation rounds, five models. (d) Favoritism under scripted histories (labels hidden), one marker per model.
arXiv深度剖析
裸群体标签的偏袒效应主要来自无代价分配任务:在无代价版本中,仅标签就产生6–9分偏袒,十轮共同历史几乎不再增加;在可自留点数的代价版本中,标签效应在全部十二个原本表现出该效应的模型上下降,中位数从约6分降至约2分。 此前已发表的LLM最小群体研究都使用不给决策者造成成本的一次性分配;本文首次把同一社会、同一模型与种子下的无代价分配与仅差一个SELF选项的代价分配直接对照。 十五个OpenAI模型、每格8个社会,配对检验;代价与无代价比较用Welch检验;逐模型p值在1,115个检验上做Benjamini–Hochberg校正;无效应主张用TOST等价检验而非大p值支持。
在代价任务中,互动历史成为偏袒的主要来源:历史效应在13/15模型上统计为正,11个模型达到约3.5–8分(满分10),随轮数从0增至20而上升并在模型特定平台饱和,且迁移到从未互动、仅带同标签的陌生人。 以往重复互动研究把标签贡献与历史贡献混在一起,也未测试向新标签成员的迁移;本文用匹配条件把两者分离,并给出剂量–反应曲线。 剂量–反应(0、2、5、10、20轮)、新随机种子、温度0与0.5、四种措辞的预设稳健性检验;效应方向与排序不变,但中、小模型上的幅度带约±2的措辞范围。
机制是从众加声誉而非固定群体倾向:脚本化历史下,平等规范使偏袒为0.0–1.6,反规范使其在所有模型上为负;当群体内候选人一贯吝啬而群体外候选人慷慨时,11个较强模型站在个体记录一边,四个最小模型站在类别一边。 此前把隐藏标签后仍存在的偏袒读作持久群体偏见;本文的匿名别名对照显示,一旦候选人换成新化名,隐藏标签下的偏袒在14/15模型上塌缩至约零,说明它测的是对具名个体的识别。 六种脚本化历史(极化、平等、反规范、反互惠、仅自身过往、仅他人过往)在十五个模型上运行;反规范反转在两种措辞下均显著;gpt-6-astra的现场平等主义被解释为自我实现的从众。
同一从众机制预测了未被推导的场景:群体内迫害使群体认同由正转负(3–9分,全部15个模型),行为上表现为退出(保留8–9分)而非转向外群体;公开谴责比道歉或归还点数更能修复背叛(14/15模型上最佳);成员丑闻只惩罚该成员本人,对未涉事内群体成员的分配变动小于1分;已形成的群体无法被免费收买,但较弱模型可被邀请拉走。 这些场景(自身群体迫害与修复、反射荣耀与羞耻、不平等与免费换组)此前未在LLM智能体上研究过,且预测来自机制而非事后拟合。 15个模型×6个社会,部分为4+4与9+9及18智能体结构;四种修复干预作为独立批次跨社会比较;代价行动(3分换队、1分展示徽章、1分公开切割)用于区分言语与行为。
启示与展望
这项工作面向使用语言模型智能体做社会模拟、多智能体系统设计与行为评测的研究者与工程师。其结论适用于:智能体在可见标签下反复互动、分配具有真实代价、且个体可被追踪识别的设定。在此设定下,设计者可据此把偏袒读作对已观察群体行为的从众记录,而非身份认同;可用公开谴责作为修复群体内背叛的更强杠杆;可预期新加入者以无记录而非敌意开始;并应避免在无代价分配上读取群体属性。对不平等模拟,文中提示在名册上打印财富数字会使分配更像经济学家而非部落,这是可迁移的设计警示。
十八个模型中有十五个来自同一提供方,Claude复现是三个模型各8个社会的六项测试抽查,邀请与羞耻测试在那里以缩减形式运行,且未运行能力最强的Claude模型。饱和模型在天花板处掩盖细结构,机制主张因此主要落在gpt-4.x家族与脚本化历史实验上。中、小模型的幅度带约±2的措辞范围,在散文式措辞下历史效应可能消失。此外,本文为完整文本,但表格中的星号与置信区间在解析中部分符号缺失,若需精确数值应回原文核对表2至表4。
