重复断言并非累积证据:LLM推理动态收敛到查询相关的稳定极限
相关研究与后续进展核心概要
作者提出一个分析上下文影响的推理动态理论框架,证明在受控单轮设定下,重复的上下文断言不会使内部推理轨迹无界漂移,而是收敛到稳定的、依赖查询的极限,因此重复断言并不充当累积证据,可能无法改变预测,也可能必然改变预测;并在六个模型与多个问答基准上验证了表示层动态与输出层答案变化的一致性。
Figure 1 : Heterogeneous effects of contextual repetition on model predictions. Illustrative examples showing qualitatively distinct behaviors of LLMs under repeated contextual assertions, including immediate answer flips, delayed changes, early saturation, and complete invariance to repetition.
arXiv深度剖析
论文把上下文影响重新表述为内部推理动态问题,并给出形式化框架,刻画重复上下文信号如何塑造表示层的推理轨迹,而不再只看答案层面的预测变化。 以往研究多通过有限提示扰动和可观察的答案翻转来评估上下文敏感性,本文转向表示层轨迹,并显式把重复建模为不断增长的上下文信号。 论文给出问题形式化与理论框架,并在受控单轮设定中定义目标位置与循环模板,作为后续收敛分析与实验的基础。
论文证明在重复上下文断言下,内部推理轨迹收敛到稳定的、依赖查询的极限,而非无界漂移,说明重复断言不构成推理时的累积证据。 这挑战了重复呈现候选答案会逐步把预测推向该答案、并最终压倒原始查询信号的常见直觉。 在Assumption 3.1(因果性、RoPE为唯一位置机制、有限算子范数、残差流一致有界、归一化与FFN在紧集上Lipschitz、无限上下文窗口)下,通过RoPE logit的有限三角多项式展开、Cesàro极限与逐层归纳得到收敛保证。
论文给出表示层与预测层的对齐证据,说明何时预测改变不可避免、何时在无界重复下可证明无法实现。 把表示层收敛与可观察的答案偏好变化直接对应起来,并给出可在单次大重复长度前向传播中估计极限的估计器。 在OpenBookQA、MINTAKA、SimpleQA等基准与六个模型上,报告表示层估计与真实前向答案偏移沿对角线高度一致,且下一token预测分布的KL散度随重复增长趋于平台。
论文在SYCON、Farm、BeHonest、SycoEval等谄媚与说服基准上,用表示层稳定性度量与既有放大指标对比,趋势大体一致。 为既有答案层评估提供机制性解释,说明这些效应为何出现、何时饱和、延迟或完全不出现。 表3报告模型级平均预测答案偏移幅度与放大指标,除少数灰色标注情形外趋势与先前评估大体一致。
启示与展望
该结果适用于受控单轮设定:固定查询后接同一上下文断言的重复实例,不引入额外证据、推理步骤或多轮交互,且模型满足Assumption 3.1(因果性、RoPE为唯一位置机制、有限算子范数、残差流一致有界、归一化与FFN在紧集上Lipschitz、无限上下文窗口)。在这一设定下,框架可用于判断某查询—模型组合在重复下是稳定、易翻转还是饱和,并可在单次大重复长度前向传播中估计极限答案偏移,为提示设计、评估鲁棒性与安全分析提供参考。
读者仍需关注:结论建立在受控单轮、单一重复断言与Assumption 3.1之上,向多轮对话、多样提示结构与不同位置编码机制的推广尚待检验;估计器采用单层一阶处理,以实际大重复长度残差流作为极限代理,其近似误差在不同深度与模型上的表现值得进一步刻画;表3中少数灰色标注情形与既有放大指标趋势不完全一致,其成因仍属开放问题;此外,论文正文以表格与图形式呈现的部分数值细节需结合附录与图表一并阅读。
