跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

后训练把语言模型的信念状态切成因果商:信息多被重路由或重标度,只有持续权重衰减才真正抹除

作者在隐马尔可夫世界中让预训练模型恢复贝叶斯信念状态,用只读任务变量的奖励定义精确的奖励零核,并分别测量奖励零信息是否仍可线性解码、决策是否仍因果依赖它、以及它占多少激活方差;结果显示后训练大多把这类信息重路由或重标度而仍可解码,KL锚定使决策继续使用它,无锚定则决策停止使用,只有长时间权重衰减才把奖励与下一词预测都看不见的分量真正抹除,开放语言模型在上下文信念几何上呈现同样的解离。