后训练把语言模型的信念状态切成因果商:信息多被重路由或重标度,只有持续权重衰减才真正抹除
相关研究与后续进展核心概要
作者在隐马尔可夫世界中让预训练模型恢复贝叶斯信念状态,用只读任务变量的奖励定义精确的奖励零核,并分别测量奖励零信息是否仍可线性解码、决策是否仍因果依赖它、以及它占多少激活方差;结果显示后训练大多把这类信息重路由或重标度而仍可解码,KL锚定使决策继续使用它,无锚定则决策停止使用,只有长时间权重衰减才把奖励与下一词预测都看不见的分量真正抹除,开放语言模型在上下文信念几何上呈现同样的解离。
Figure 1: From a belief state to its fates. I. A hidden Markov process with a task and a nuisance variable generates tokens, and a pretrained transformer represents the belief state b t b_{t} . The reward reads only the class marginal b κ b^{\kappa} (large simplex). Beliefs that share it form a reward-null fiber (small simplices), with one direction the next token can see and one it cannot. Each card shows one fiber in the representation (plane) and the decisions its points map to (track; dashed: the base model): erased (collapsed), rerouted (intact, every point mapped to one decision) or rescaled (shrunk, mapped to the same decisions as before), with the fate’s signature in R R , U U and A A . II–IV. Three results in preview (open circles in III: long training with weight decay).
arXiv深度剖析
论文把“表示压缩”拆成三种可分别测量的命运:抹除(可解码性下降)、重路由(仍可解码但决策不再因果依赖)、重标度(仍可解码且仍被使用,但方差份额下降),并在奖励只读隐藏状态粗函数的设定下用闭式奖励零核给出判定标准。 此前关于后训练的几何与谱研究只能观察到表示发生变化,无法判断变化属于信息丢失、读取方向改变还是可逆重标度;这里用训练前即可计算的奖励零核把三者分开。 在可精确求解的隐马尔可夫世界中,四个世界与多种动作设计下用探针、孪生交换干预与有效秩统计分别测量三个坐标,并预先注册子空间、判据与预测。
KL锚定决定决策是否继续使用奖励零信息:锚定目标保留参考策略在等奖励输出间的对数几率,训练网络在实用系数下达到该最优(斜率0.93至1.02),而监督微调与无锚定策略梯度让决策停止读取仍可解码的分量。 把KL正则最优保留等奖励输出比例的已知结论,推导为对信念状态的具体含义,并在训练网络中验证,同时给出移除锚定后取而代之的行为。 在匹配奖励下KL-RL与SFT达到相同奖励(0.691与0.693)却分别保留与失去决策敏感性;无锚定时策略梯度把每个类坍缩到单一词元,而下一词可见分量仍可解码。
真正的抹除需要目标之外的持续压力:在权重衰减1、50,000步的压力测试下,SFT与全新词元目标把下一词不可见分量压到基线的0.001至0.012,而锚定策略在同样压力下仍保留0.64并维持参考对数几率。 说明奖励的漠视本身不抹除任何信息,抹除的界线取决于目标中是否有任何一项需要该区分。 抹除随时间推进(SFT下10、30、50千步分别为0.69、0.30、0.001),且循环模型在权重衰减角落沿与Transformer相同的路线抹除。
开放语言模型复现同样的解离:三个Qwen基座与后训练检查点对上,上下文信念几何与下一词不可见分量的可解码性峰值变化不超过0.05与0.06,而后半网络有效秩下降12%至19%;受控粗类GRPO中带锚定在1,000步内回到参考对数几率,无锚定则放大十至二十倍且无坍缩。 把精确世界中的三坐标框架与锚定作用迁移到预训练语言模型的上下文合成流上,并显示小Transformer与语言模型离开锚定恒等式的方向相反。 三个检查点对、两个模型规模、多种参数化与训练长度下结论一致,两个核分量在所有运行中保持可解码。
启示与展望
该框架适用于预训练能恢复贝叶斯信念状态、且决策为单步且动作不回馈进上下文的隐马尔可夫世界,此时奖励零核可在训练前闭式计算,三个坐标可分别测量。对读者而言,这提供了一个诊断清单:在评估后训练是否“遗忘”时,应分别检查可解码性、决策的因果敏感性与方差份额,而不是只看谱或有效秩;对使用KL锚定的强化学习配方,锚定系数决定决策是否继续读取等奖励输出间的参考偏好,而权重衰减等目标外压力决定哪些分量会被真正抹除。语言模型侧的结论适用于所测的1.7B与4B检查点与上下文合成流设定。
多步任务中策略会改变被访问的历史分布,此时因果商是否移动、还是只移动信念状态的支撑,仍待研究。语言模型实验覆盖一个模型家族的三个检查点对与一个受控目标,自然任务上两种效应的大小尚未测量。表示信息用线性探针测量,只存在于非线性编码中的区分会被计为丢失。小Transformer与语言模型离开锚定恒等式的方向相反,参数化与训练预算都无法解释这一差异,什么使放大在预训练语言模型中成为更便宜的方向仍是开放问题。
