受控石头剪刀布与n-gram实验显示:更长上下文不提升策略识别,二阶依赖显著削弱规则执行
相关研究与后续进展核心概要
作者用受控双人石头剪刀布(统计型与马尔可夫型玩家,上下文100至1000轮)和单人随机n-gram续写任务(阶数1至8),分离策略识别、边际分布匹配与条件规则执行,发现马尔可夫策略比非马尔可夫更难识别、更长上下文不改善甚至降低识别、正确识别不保证忠实模拟、二阶依赖使严格规则匹配明显下降,且提供转移规则或更长前缀都不能消除高阶退化,而仅用前缀的经验n-gram估计器在高阶仍较稳定。
Figure 3: Identification accuracy across seven model configurations, averaged across context lengths. Bold model labels and asterisks indicate significant Markov–Non-Markov differences ( p < .001 p<.001 ).
arXiv深度剖析
在闭集候选池下,马尔可夫(依赖历史)玩家的识别准确率平均低于非马尔可夫玩家,七个模型配置中六个差异显著,GPT-5是唯一例外;把观测轮数从100增至1000并不改善识别,反而常使其下降。 以往游戏类评测多以对局表现或对手识别为终点,这里把识别拆成对已知生成过程的闭集恢复,并单独比较马尔可夫与非马尔可夫两类策略。 七个模型配置、每上下文长度各50组统计-统计、50组马尔可夫为P1、50组马尔可夫为P2;同一批轨迹上非LLM最大似然基线在各上下文长度均达100%准确率,且其后验质量更集中于马尔可夫玩家,说明轨迹本身可恢复。
正确识别能提升规则跟随,但识别与模拟并不等价:错误身份并非随机,若干模型在身份错误时规则重叠仍高于随机基线;在正确身份子集上马尔可夫玩家的MSE比非马尔可夫高出100%以上,而整体仅高约8–9%。 把边际分布匹配与条件规则执行分开度量,显示分布相似性可能掩盖错误的生成机制。 282个被错误恢复的策略中,41.8%落在目标边际分布的TV阈值内,62.1%落在更宽阈值内;累积严格规则匹配曲线显示规则跟随质量在生成早期即基本确定,之后趋于平稳。
教师强制把即时规则应用与长程维持分开:DeepSeek Reasoner与GPT-5在真实历史下下一步准确率分别为93.3%与82.5%(正确身份子集97.2%与89.5%),而DeepSeek Chat与GPT-5-mini仅52.5%与54.2%(66.7%与70.0%),说明前者主要难在长程维持,后者连局部规则应用都受限。 用教师强制作为诊断手段,把自由生成中的错误归因到两个不同环节,而非笼统记为模拟失败。 表1报告全部案例与正确身份子集两栏准确率,覆盖四个核心模型配置。
结构压力测试指向历史依赖阶数而非联合状态:加入联合状态信息不降低规则跟随,二阶规则带来主要下降,且此时身份识别准确率仍高;在单人随机n-gram任务中,阶数升至8时多数模型CCLG骤降、WJS上升,把前缀从256增至2048或直接给出转移规则都不能一致地消除退化,而仅用前缀的经验n-gram基线在高阶仍相对稳定。 通过去掉玩家归因与石头剪刀布语义,把瓶颈定位为生成过程中维持并应用高阶条件转移结构。 实验3仅用deepseek-reasoner,每规则族各60组马尔可夫为P1与P2、生成1000轮并按100轮窗口评估;单人任务使用CCLG与状态频率加权JS散度,并配有仅用前缀的n-gram MLE基线作参照。
启示与展望
该框架适用于候选策略集合已知、生成过程可精确指定的受控诊断场景,例如需要区分频率匹配与条件规则执行的代理评测。对使用LLM做行为模拟、多轮工具调用或对手建模的研究者与工程师,它提供了一套可复用的分离式指标:识别准确率、边际分布误差、严格与累积规则匹配、教师强制下一步准确率,以及高阶生成中的CCLG与加权JS散度。单人n-gram实验进一步说明,即使去掉玩家归因与石头剪刀布语义,仍可用同一套指标考察条件转移结构的维持能力。
策略空间是预定义闭集,开放式的策略发现未被覆盖;轨迹以符号形式表示,输出经受限格式与解析规则评估,提示词、表示与解码设置是否最优无法保证。实验3的结构分析仅使用deepseek-reasoner,联合状态与二阶依赖的结论在其他模型上是否同样成立仍是开放问题。单人n-gram任务中部分模型在给出规则与概率的设置下有效完成率偏低,指标差异在多大程度上反映规则跟随失败而非输出格式失败,值得进一步区分。此外,模型访问时间与API别名解析情况属于特定时点,复现时需注意版本差异。
