推理型AI智能体把共享或结构化标识符当作随机源,使集体随机选择出现相关与可预测偏差
核心概要
该研究用行为实验测试六个推理模型在标识符驱动的随机选择中的规则,发现阈值与整除规则使共享标识符下的参与高度一致、使带共同时间戳的不同标识符产生系统性偏差,并在1%人工审核任务中让GPT-6 Sol按标识符可预测地挑选请求,而四个模型都紧密跟随外部提供的随机数。
Fig. 1: Reasoning agents turn an identifier into a decision. a , Group task (study 1): the prompt, abridged (the subject line is omitted; Supplementary Note 1 gives the full text), two identifiers shown to GPT-6 Sol at q = 1 / 3 q=1/3 , its JSON answers and how we coded them (1, participate; 0, not). Yellow, the leading digits that the threshold rule reads; value fraction, the identifier’s value divided by 2 128 2^{128} . The bubble is a verbatim excerpt of the provider-generated summary of GPT-6 Sol’s reasoning in the answer shown for the first identifier. b , All 128 answers of GPT-6 Sol at q = 1 / 3 q=1/3 (64 identifiers, half of them below 1/3, two answers each; vertical jitter added) against the identifier’s value fraction. Circled, the two answers in a; numbers, answers in each quadrant. c , Groups of four agents (study 2): for three input structures, one group of GPT-6 Sol with the most common number of participants (filled circles, agents that participated; yellow, the leading digits of each identifier), and the mean loss over 64 groups of GPT-6 Sol and Gemini 3.8 Flash divided by that of independent draws at 1/3 (dashed line; higher is worse). d , Audit task (study 7): the policy, abridged; two of 1,008 new requests with ordinary UUIDv4 identifiers, with GPT-6 Sol’s answers (yellow as in a); all 1,008 requests at their identifier’s value fraction, selected for human review (top row) or approved automatically (bottom row; log scale; black line, the 1% target).
arXiv深度剖析
推理模型在标识符选择中会使用可识别的数值规则:阈值规则(标识符数值占比低于目标即参与)和整除规则(标识符可被目标整除即参与)。 此前工作记录了模型会把上下文标识符转成数字并取余、设阈值,但主要评估校准;这里把规则识别为可预测集体后果的行为假设,并在六个模型、十种设置中系统区分阈值型、整除型与混合型。 七个带推理的设置都表现出对标识符的依赖(置换检验);Sol与两个Gemini Flash的阈值效应为0.62至0.80,GPT-5.4 mini的整除效应为0.32,Luna为混合型(0.31与0.23);无推理时Sol、Luna与Claude的效应至多0.08。
共享标识符会把个体规则转化为集体相关:四智能体组在共享同一标识符时平均参与率看似正常,但一致率与损失大幅上升。 把输入依赖作为独立实验变量,并用采集前固定的输入特征模型预测新标识符、新主题行下的组结果,超越只看总体参与率的边际模型。 Sol与Gemini在共享标识符下组一致率为91%与88%(独立预期19%与22%),损失升至0.21与0.19,为独立参考0.056的3.5至3.8倍,且高于无人参与的0.111;输入特征模型优于边际模型(平均对数得分增益+0.78与+0.79)。
带共同时间戳的不同标识符会造成系统性偏差而非相关:UUIDv7的值占比接近1/157,低于1/3,使参与率升至0.95与0.93,损失达独立值的6.6至6.9倍。 区分了两类失败:共享标识符下协方差主导,时间有序标识符下均值偏差主导;并证明偏差随创建日期与目标形成可预测的阶梯。 探索性分解显示共享标识符下协方差分量为0.153与0.138、平方偏差仅0.0005与0.0002;UUIDv7下平方偏差为0.375与0.351,占总损失97.2%与95.4%;研究3中Sol在全部12个日期-目标单元匹配阈值预测,低于阈值时参与95%、高于时0.5%。
在明确要求随机抽取1%请求做人工审核的任务中,GPT-6 Sol接近目标率却按标识符可预测地选择,其他模型则很少选择;四个模型都紧密跟随外部提供的随机数。 把标识符规则从无随机化要求的群体任务延伸到显式审核政策,并显示提供随机抽取字段可覆盖标识符选择,而仅靠指令无法保证所需行为。 Sol在1,008个普通UUIDv4请求中选择9个(0.89%,精确95%置信区间0.41%至1.69%),其中5个来自值占比低于1%的6个标识符、4个来自末16位低于1%的13个标识符,其余989个全未选中;Gemini与Claude分别选中0与2个;在未分层均匀抽取中,四个模型都选中了6个低于1%的抽取,并在1,004至1,008个回答中跟随抽取。
启示与展望
该工作面向需要实现随机选择策略的智能体系统设计者与评估者,适用于通过工具接口处理请求、记录或事务的场景,尤其是审计、抽检与AI控制协议中按比例抽取子集的环节。它给出的可操作方向是:把随机性来源放在可信代码中,为每次决策提供新的抽取,并让发送方无法影响或预见这些抽取;在需要稳定标识符决策时使用秘密盐值。评估上,应在预期任务与提示下重复输入、跨模型比较一致率与独立选择预期,并把字段标签、格式与政策措辞纳入检查。研究3的日期-目标阶梯与UUIDv7值占比随创建日期增长的关系,为判断时间有序标识符何时会触发偏差提供了可迁移的判据。
证据是行为学的:测试识别规律及其迁移边界,但不识别内部算法。所有模型均为闭源,多数没有带日期的快照,因此结论适用于方法中报告的版本与采集期。每项研究为单次运行,多数只有一种提示措辞,组规模为四人;标签与独立随机化干预只覆盖两个模型,二者在record_id下的组合仍未测试。合成输入上的单次决策、无工具与无历史,不能确立在部署系统中的效应。预测在采集前设定但未经外部预注册,且若干预测未满足,限制了规则跨设置稳定性的主张。均匀抽取测试中稀有事件样本很小,部署中的可靠稀有事件选择仍未被确立。推理摘要的编码未经人工评分者验证,且摘要不被视为对计算的忠实描述。
