跳到主要内容
返回时间线
arXiv来源发表:

把KDA的门改成可正可负后,单层CKDA能跟踪有限群并外推周期波形,1.3B模型下游精度与KDA持平

核心概要

该工作提出Complex KDA(CKDA):在Kimi Delta Attention基础上同时放开门控符号(gate entries in {−1,+1})与delta-rule系数范围(β∈[0,2]),使单次对角加秩一转移即可实现二维旋转;作者证明每个正交对角加秩一矩阵都恰是一个CKDA转移,单层CKDA可跟踪同构于O(2)子群的有限群、多层结果比同类对角加秩一线性RNN少用一层,并在群词问题、周期音频续写与语言建模上给出实验。

AI-generated editorial illustration: Complex KDA: Understanding and Enhancing the Expressivity of Kimi Delta Attention

深度剖析

CKDA用一次对角加秩一转移实现二维旋转:通道级门提供一次坐标反射,与delta-rule的Householder反射复合,从而产生复共轭特征值。 此前DeltaProduct需要在一个token内复合两次delta-rule转移才能建模二维旋转,代价是秩与更新成本上升;KDA的标准非负门只能给出实谱,GDN的标量门更是与任何矩阵可交换、无法打破对称性。 论文给出机制推导:标量门下转移矩阵是两个对称矩阵之积且可交换,故谱为实;通道级门在门值异号且键在两个坐标上非零时不交换,但严格正门仍相似于对称矩阵,只有允许门取负号才可能出现非实谱。二维展开式给出判别式为负的条件,端点处转移成为两次反射的复合,即旋转。

作者刻画了CKDA转移的谱结构,并证明每个正交对角加秩一矩阵都恰好是一个CKDA转移(signed-Householder形式)。 这把CKDA从一种具体参数化提升为对整个正交DPR1族的完整刻画,并说明把KDA的结构化秩一项换成非对称项(如RWKV-7)并不会增加正交转移。 定理1给出正交DPR1矩阵可写成带符号Householder形式;定理8证明CKDA矩阵至多有一对非实特征值,且必须同时满足β>1与至少一个门为负;定理9进一步证明任何非扩张秩一DPLR转移在单位圆上至多有一对非实共轭特征值。

状态跟踪表达力提升:单层CKDA可跟踪所有同构于O(2)子群的有限群,且许多跟踪结果比同类对角加秩一线性RNN少用一层。 论文同时给出上界与下界:单层可跟踪循环群与二面体群(含在三维中实现立方体旋转群),但定理4证明在有限可达与非扩张条件下,单层CKDA与k≥2的DeltaProduct都无法跟踪S5;三层CKDA可解所有有限群词问题,并在允许β>2时识别所有正则语言、以多项式精度计算WFA,比DeltaNet/GDN的四层构造省一层。 构造性证明给出显式转移与解码器(含四维中跟踪A5的编码器与二次解码器,可达隐藏矩阵至多120个);下界依赖有限可达性假设下的正交化归约与一个关于两个平面旋转的引理。

实验显示只有同时放开两项范围时,CKDA在群词问题与周期音频续写上才出现长度外推,语言建模中与KDA持平并优于Transformer等基线。 在测试的四种KDA范围设置中,只有CKDA在S3、S5与周期波形续写上外推良好;训练后的1.3B模型确实学到负门、β>1与复特征值对,且主要出现在前两层。 单层模型在长度32内训练、报告三次种子的最优;音频任务在训练长度136之外、长度264处保持dB级SNR,而因果Transformer下降;1.3B参数、100B token的FineWeb-Edu训练中CKDA平均下游精度与KDA相近,并高于Transformer与其他线性RNN基线;核实现保留约KDA吞吐的一部分。

启示与展望

该结果面向研究线性RNN表达力与状态跟踪的读者,以及需要在长序列上保持相位或群结构信息的模型设计者;适用场景是单层或三层递推、精确算术或固定精确数据类型下的构造性分析,以及1.3B参数、100B token量级的语言建模对照。它使后续工作可以在不引入辅助递推状态或显式相位门的前提下,用带符号通道门获得旋转动力学,并复用现有KDA核。

论文自述表达力结果不蕴含可学习性:A5可被表示,但在标准随机初始化下未被学到,只有靠近四元数构造初始化的小模型才实现外推。一般WFA构造需要β>2,牺牲了非扩张保证,并依赖固定代数数域上的精确算术;浮点近似下的误差累积未做分析。门与β在训练中被使用,但其功能角色尚不清楚,作者将其留作未来工作。此外,本文所依据的文本在若干处省略了具体数值与图表编号,因此部分实验数字只能按文中给出的范围或相对比较来理解。

来源