给注意力加一条段落坐标后,真实段落比随机标签压得更深,但深度随语料变化且无语料统计量能完全复现
核心概要
作者用分层旋转位置编码(hRoPE)把段落、句子、词元索引拆成独立通道,在固定词元序列的前提下干预段落坐标,并用与词元距离精确匹配的估计量测量跨段落注意力,发现三个语料中注意力都被压缩,但密度匹配的随机标签通道同样被压缩,真正区分真实结构的是压缩深度——真实结构更深且随语料变化,而随机对照不随语料变化;比较词法持续性、段落长度与基于嵌入的连贯性三类共八个语料统计量,没有一个能完全复现深度的跨语料排序,其中基于嵌入的连贯性最接近。
深度剖析
在固定词元序列、只改变段落坐标的条件下,注意力会发生变化,说明段落层级位置是注意力的因果因素,而非词元内容的产物。 此前的位置编码工作把位置当作一维阅读顺序坐标,或把层级坐标用于生成与效率;这里把段落坐标单独拿出来做反事实干预,并配以密度匹配的随机标签对照与周期镜像对照。 三个语料(WikiText-2、OpenWebText、Python 代码)各三个种子;合并段落使注意力压缩、拆分段落使其扩张;无段落通道的 flat 与 sent_axial 按定义无效应;rand_axial 响应明显更弱。单例演示被作者明确标注为“illustrative example, not a statistical result”。
压缩本身不是真实结构的判据:密度匹配的随机标签通道在每个语料中同样被压缩,只是更浅;区分真实与随机的是压缩深度。 把“注意力在段落边界附近被压缩”这一现象与“该压缩是否指示真实层级结构”分开,并给出配对文档簇自助法下的深度差。 配对文档簇自助法显示 hrope_axial 与 rand_axial 的深度差在 Code 与 WikiText-2 中排除零,在 OpenWebText 中区间包含零、按作者说法“not resolvable at our seed count”;作者明确不把 OpenWebText 的结果当作任一方向的证据。
压缩深度随语料变化,而随机对照的深度随语料变化更弱;但八个语料统计量中没有一个能完全复现深度的跨语料排序。 把模型侧学到的深度与完全由语料计算、不依赖任何模型表示的候选量做对照,并报告一个此前因距离分箱合并方法问题而看似成立的对应关系在修正后不再成立。 三类构念共八个量:词法持续性五个变体(其中一个是重标定、按构造共享排序,不算独立数据点)、段落长度中位数、基于嵌入的连贯性两个摘要;作者按构念而非表格行计数,结论是词法持续性与段落长度不匹配,嵌入连贯性最接近但三对语料中仍有一对未分辨。
在可识别内部极小值的两个语料中,响应曲线先增强后反转,这种形状不能被“单调衰减吸引项加单调增长抑制项”的加性叠加产生。 用一个命题排除最简单的加性竞争过程族,把转折定位到某种交互,而不是把它当作两个独立单调过程的平凡叠加。 命题 5.1 给出离散一阶差分为严格正的证明;作者同时说明这只排除加性族,softmax 竞争型与非单调替代模型未被检验,并把它列为主要的开放机制问题。
启示与展望
这项工作面向研究位置编码与长文档建模的读者,适用于 8 层、512 维、上下文 1024、训练 5000 步的小规模设定,以及 WikiText-2、OpenWebText 与 Python 源码三个语料,段落按各语料自己的定义(散文中的分隔块、代码中的空行分隔块)。它使后续工作可以:把段落坐标当作可单独干预的变量来检验模型是否使用层级位置;用密度匹配随机标签与周期镜像作为对照来区分“通道存在”与“通道内容”;把压缩深度而非压缩位置当作可复现的量来追踪。作者也指出,句子层级的同类签名未被处理,周期坐标在该协议下不可检验,且未评估生产规模与下游指标。
跨语料排序是描述性的:文档级自助法只量化语料内不确定性,三个语料是按选择固定的而非从共同总体抽取,因此“Code 深于 WikiText-2 深于 OpenWebText”只说明语料间存在差异,不说明该顺序可推广。OpenWebText 上真实与随机的深度差在现有种子数下无法分辨,作者明确不把它当作任一方向的证据,也无法区分真零与功效不足。压缩深度的来源仍开放:被检验的三类构念都不复现排序,但作者只排除了这些具体解释,不排除其他语料属性或架构与训练动力学。机制上只排除了加性竞争过程族,softmax 竞争型与非单调替代未被检验。此外,WikiText-2 的深度位置结构性不可识别,深度本身在不同采样门槛下也有约一个门槛置信区间宽度的漂移;掩码探针只用了每个语料单个检查点,属探索性。若只读到摘要而缺少图表与附录,上述门槛敏感性、种子级方向性证据与探针细节都无法核对,这是阅读时需要留意的开放之处。
