跳到主要内容
返回时间线
arXiv来源发表:

冻结权重下,单个第14层rank-8 LoRA把Qwen3-8B的24行引用链准确率从15.5%提到99%

核心概要

该工作测量了预训练Transformer在上下文中跟随引用链的能力:十三个基座模型只能可靠跟随1.4–3.6行(中位数2.2),额外预训练循环也帮助有限;在全部权重冻结的前提下,于某一早期层训练一个rank-8 LoRA即可延长这一计算,使Qwen3-8B在24行链上的精确准确率从15.5%升至99%,更长训练的LoRA达到50行,Ouro-1.4B在四循环后达到60行、八循环后至少160行,机制上表现为LoRA在中层启动一段“接力”,由冻结的注意力头沿链逐步向上读取,移除父行注意力即中断该接力。

AI-generated editorial illustration: Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

深度剖析

预训练模型默认的引用跟随计算很短:十三个基座模型可靠跟随1.4–3.6行(中位数2.2),Qwen3-8B在三、四、五行的选择准确率为83.5%、54%、41.5%,DeepSeek-V4-Flash(292B MoE)达到4.0行但在六行和八行仅为42%和38%(三链随机水平33%);Ouro-1.4B在一到五循环后的reach为0、1.6、2.3、2.2、2.2,Huginn在8、16、32次递归后仅1.4–1.6行。 此前关于多跳组合与循环深度的研究多关注模型能否组合事实,或循环结构能否带来可调推理计算;这里把问题定位为“默认前向传播用到的深度不足”,并用同一套reach与read-out指标同时覆盖标准模型与循环模型。 十三个基座模型加DeepSeek-V4-Flash的panel,标准模型survey每格200个程序;循环模型实验通常150个程序;reach定义为80%准确率的首个下穿点并线性插值。

在所有权重冻结的情况下,单个早期层的rank-8 LoRA即可大幅延长引用链:Qwen3-8B第14层LoRA仅训练65,537个参数(不到模型0.01%),把16、20、24行链的精确准确率从15.5%、14.5%、15.5%提升到98.5%、98.0%、99.0%(24行为200题中198题正确,95% Wilson区间96.4–99.7%);更长训练的LoRA在40行和48行达到98%和88%(冻结为4%和9%),reach达50行。 与训练循环模型做hop外推或逐循环监督不同,这里不改变任何预训练权重,只用一个表示层级的低秩编辑,就释放出冻结层中已有的计算。 200题/格的headline评测,三个训练种子在24行得94.7–97.5%;WikiText-103困惑度从10.14变为10.148作为文本分布对照。

循环模型上,LoRA让额外循环变得有用:Ouro-1.4B标准LoRA在一、二、三循环后reach为1.9、7.1、17行,四循环后通过所有测试长度至24行;更长训练的LoRA在四循环达60行、六循环约146行、八循环至少160行(160行准确率87%,为最长训练链的四倍);Huginn更长训练LoRA在八次递归达31行、十六次达58行(95%区间37–64)。 预训练循环模型此前表现为重复同一段短计算,额外循环收益递减;这里显示循环体本身可以承载更长的接力,只要在正确位置启动它。 reach估计带95%参数自助区间,每格通常150个程序,长链与Huginn用100或60个程序;第二个更长训练种子在四循环为52行而非60行。

机制上,LoRA在中层启动一段“接力”:Qwen3-8B的relay在16–22层输出处依次到达第5、6、6、8、9、13、16行,冻结模型在第17层到第4行即停止;注意力随接力推进而读得更远(16–18层两行,19–22层三、四、六、七行),且移除指针对其父行的注意力会把六、八、十二行链打回随机水平(53%、48%、55%),而在接力之后(23–29层)做同样切除则保持100%、100%、98%。 这把“小改动为何有效”从相关性推进到因果干预:接力发生在冻结的中层,LoRA本身不跨token传递信息(只作用于程序token即可保留增益,只作用于query仅增加两到四行)。 结合因果追踪(恢复干净残差状态)、注意力敲除与线性read-out;Ouro中移除七个长读头使四循环reach从约24降到12.0,对照为二十次同层随机抽头的12.0–17.4。

启示与展望

这项工作面向研究引用跟随与多跳组合的读者:它给出一个可复现的合成任务、一套reach与read-out测量,以及一个在冻结权重下启动中继的干预配方,适用于需要在特定任务格式上延长上下文内组合计算的场景。对适配实践者,结论是放置位置决定哪些有用计算还能跟随改动:Qwen3-8B从第20层移到第21层,reach从20.5行降到5.2行;Ouro中只在最后一个循环施加LoRA时,第6层仍有21.6行而第20层只有2.6行(冻结2.5)。对推理侧,重复有用的中段层也有帮助:Qwen3-8B重入14–22层,64行精确准确率从一次通过的34%升到一次重入66%、两次重入92%(冻结10%)。MuSiQue上早期层LoRA在Qwen3-8B、OLMo-3-7B、Llama-3.1-8B分别增加11.4、9.4、17.9个精确匹配点,早期投影LoRA保留了大部分全层增益。

机制任务为合成且上下文内,MuSiQue主要提供放置层面的证据而非同一机制的直接证据;详细追踪集中在Qwen3-8B与Ouro-1.4B,循环模型覆盖两个家族且Ouro-2.6B由Ouro-1.4B扩展而来;LoRA按任务格式分别训练,文本惩罚只是被测量的对照,放置预测精度有限,仅首循环充分性只验证到约25行,最长链的循环结果使用level order且每个循环都施加LoRA。学习到的路由方向与最小充分秩仍未确定,因果测试约束了计算但没有唯一确定其算法;从零训练的小模型给出注意力距离与接力推进的对应关系(165个层步中108步完全一致),可作为进一步验证的入口。

来源