在维基百科导语上玩 log(N)-Questions:成对前沿模型之间的通信效率
核心概要
该技术报告将 Potash 与 Suleman(2019)提出的双智能体 log(N)-Questions 游戏移植到六个前沿语言模型上,让提问者面对 N 篇维基百科导语段落、用恰好 log2(N) 个是非问题找出隐藏目标,而回答者只能看到目标与问题并回复一个词,共运行 408 局、文档集规模从 4 到 1024、总 API 成本 363 美元,发现领先的五个模型之间仅能勉强区分,其胜率随集合规模下降可由单一每轮可靠性参数 p=0.928 的 win=p^{log2 N} 拟合,损失大致均分为回答错误与区分失败,且失败主要源于通信而非推理。
深度剖析
报告给出了一个冻结、可复现的协议,在 N=4 到 N=1024 的嵌套文档集与可前缀扩展的目标分配上运行该游戏,六个模型臂共 408 局,全部使用相同文档与目标,使跨模型比较成为配对比较。 原版 Potash 与 Suleman(2019)用 Gumbel-softmax 离散通道端到端训练两个智能体并在小规模句子集上评估;本工作改为在预训练前沿模型上零样本运行,智能体从不共同适应,因此测的是协议是否已经存在,而非能否被学会。 六个完整模型臂、每臂 68 局、相同文档与目标;文档集嵌套、目标按位反转顺序发射以保证前缀分层;代码、语料与逐局日志全部公开。
合并五个领先模型后,胜率随集合规模单调下降,与 log2(N) 的相关系数为 r=-0.973,并可由单一每轮可靠性参数 p=0.928 的 win=p^{log2 N} 拟合;反推该拟合,十步内达到抛硬币水平需要 p≥0.933,五十步需要 p≥0.986。 报告把随规模下降归因于失败机会数增加而非单步任务变难,并指出在 p=0.93 时三轮可存活而十轮不可,除非提高 p,否则改善单轮推理质量无济于事。 九个集合规模、三个数量级上的拟合;每个模型单独的相关系数均为负(-0.88、-0.83、-0.90、-0.82、-0.63、-0.46);每轮失败率在时间跨度上平坦(χ²=10.5,df=9,p=0.31),一轮失败不提高下一轮失败概率;作者同时说明未检验独立性假设,且 p 是对五个模型合并拟合的描述性结果。
通过只对目标与模型所猜文档两个文档做裁决,把每轮裁决负担从 O(N) 降到 O(1),在三位独立裁判、各 2,931 次判断下把损失分解为回答错误(47–55%)与区分失败(42–49%),预测错误仅 2–4%;裁判间一致率为 97.8–98.7%,并测得 40–46% 的自我偏好折扣。 报告把胜负这一比特拆成三种互斥失败,并指出模型几乎从不指认自身证据已排除的文档,失败发生在上游而非最终推理步骤。 三位裁判(Gemini 3.8 Flash、GPT-5.6 Sol、Grok 4.6)各约 2,900 对共享判断;每模型数字排除该模型对自身的判断;作者明确说明高一致率只表明判断可复现,而非正确,且未收集人工裁决子集。
由答案平衡估计的每问题信息量与胜率相关(r=+0.88);唯一两个每问题提取满一比特的模型,也是唯一两个按文档标题做划分的模型,该策略在 N=32 以下完全缺席、在 N=64 以上约占四分之一的问题。 报告给出一个无需裁判模型、仅由日志答案即可计算的划分质量度量,并指出按标题首字母的划分可以靠计数做到精确均分,而语义类别在有限集合上做不到。 六个模型臂的答案平衡与胜率相关;N≥64 时 GPT-5.6 Sol 为 83/320、Kimi K3 为 69/320、Grok 4.6 为 10/320,其余三个模型在 320 个问题中一次未用;作者同时指出该关系并不精确(Grok 以 0.925 比特取得 75% 胜率,高于 GLM-5.3 的 0.990),且六个点无法确立函数形式。
启示与展望
该结果适用于同一提供方内部、两个角色由同一模型担任、且提问者得不到反馈的零样本通信设定,文档集为 4 到 1024 篇维基百科导语段落,每规模一个文档集、每格八局。它可直接用于设计长程多步智能体评测、检验通信可靠性而非单步推理质量,以及为公开权重模型做本地消融;报告也指出该结构可替换候选模态以构成多模态基准。
作者列出若干待解问题:每个规模只有一个文档集,N 与集合难度混淆,N 曲线形状的结论较弱;三个提供方不允许温度控制,臂非确定性;提示词在试点中针对 Claude Opus 5 修订四次后冻结,而该模型最终垫底,作者认为这一混淆方向不利于而非制造头条结果,但无法排除提示词更契合其余五个模型的可能性;N=1024 的约 126,000 token 提示对不同模型占其训练上下文的比例不同(Kimi K3 约 13%,GLM-5 约 63%),上下文负载未均衡;四个模型的架构未公开,机制性解释只能作为假设;每提供方只选一个旗舰模型,层级结构不可通约;努力等级是标签而非统一尺度;答案平衡是对每问题信息量的间接估计,混淆了提问平衡与回答者偏差。报告还指出,被拒文档的定位只确定到“移除后集合通过”,Z.ai 是否也会拒绝另外两篇从未测试,且 Simon Cheng 段落的对照实验无法区分性内容关键词与政治叙事两个成分。
