ASPD 将权重分解锚定在激活空间,在 Qwen-3-8B 上恢复 IOI 电路并追踪语义变换
相关研究与后续进展核心概要
该工作提出激活支撑的参数分解(ASPD),联合分解激活空间与参数空间,把每个学到的权重组件锚定到它所读取或写入的激活特征上,用内部激活约束原本不唯一的参数分解,并以内部重构目标在被分析的权重矩阵处提供局部学习信号,从而在预训练大语言模型(在 Qwen-3-8B 上演示)中实现可扩展、可解释且可因果编辑的参数分解,学到的读写组件还能组合成参数级机制电路,用于恢复经典 IOI 电路背后的机制并沿模型权重追踪语义变换。
Figure 1: Parameter-level mechanisms recovered for the IOI circuit ( Wang et al., 2022 ) . ASPD identifies weight components implementing known head-level computations and connects them through read–write interactions across heads. For example, the duplicate-name component 224 O 224O of H3.0 and the induction component 228 O 228O of H5.5 provide inputs to the downstream S-inhibition mechanism in H8.6.
arXiv深度剖析
提出 ASPD,把激活空间与参数空间联合分解,并将每个学到的权重组件锚定到它所读取或写入的激活特征上。 既有可解释性方法大多分别研究激活空间与参数空间,本文把“被表示的信息”与“参数级计算”连接起来,填补这一空白。 摘要层面给出方法设计与动机,并说明该锚定用模型内部激活约束原本不唯一的参数分解;演示模型为 Qwen-3-8B。
引入内部重构目标,在被分析的权重矩阵处提供局部学习信号,使分解可扩展、可解释且可因果编辑。 相对仅依赖全局或外部目标的分解方式,这里在权重矩阵层面提供局部学习信号,从而支持规模化与因果编辑。 摘要陈述该目标与上述性质,并称在预训练大语言模型上得到演示;未给出具体量化指标。
学到的读写组件可组合成参数级机制电路,并用于恢复经典 IOI 电路背后的机制、沿模型权重追踪语义变换。 把参数分解结果提升为机制电路层面的分析对象,使权重层面的组件能够对应到已知电路与语义变换。 摘要报告在 Qwen-3-8B 上以 IOI 电路与语义变换追踪作为演示案例;未提供电路匹配度或编辑效果的数值。
启示与展望
该工作面向预训练大语言模型的参数级可解释性与编辑,演示设定为 Qwen-3-8B,方法以激活特征锚定权重组件、以内部重构目标提供局部学习信号,适用于需要把权重组件对应到具体读写特征、并希望组合成参数级机制电路的分析场景;摘要所述案例为恢复经典 IOI 电路机制与沿权重追踪语义变换。
摘要未给出分解质量、因果编辑效果或电路恢复的量化指标与对照条件,也未说明计算开销与超参数敏感性;这些属于需要阅读正文确认的开放问题。此外,加载文本为摘要级内容,未包含图表与实验细节,因此对可扩展性与可编辑性的实际强度只能作为待验证问题保留。
