LatentPort 让 4B 混合模型的循环记忆直接交给 9B 接收方,无需重读历史前缀即可把续写损失压到仅高于原生 9B 0.076 nats/token
核心概要
该工作在一个架构匹配的 Qwen3.5 4B→9B 混合模型(Gated DeltaNet 加全注意力)配对中,把源模型读入前缀后产生的持久推理状态(注意力 KV、GDN 循环矩阵与卷积历史)直接安装到更大的接收模型上,不做目标前缀重放;在固定翻译 KV 的基础上加入 GDN 持久状态包使教师强制 NLL 下降 0.747 nats/token(95% 配对文档自助 CI [0.6921, 0.8047]),全部 64 篇 PG19 文档均改善,直接复用循环与卷积状态优于所测试的学习式 GDN 映射,再叠加 434,176 个可训练参数的秩 4 修正后,续写损失仅高于原生 9B 0.076 nats/token、JS 散度 0.022、原生上下文恢复 NCR 0.
深度剖析
在混合语言模型中,可迁移的推理状态不止注意力 KV:固定翻译 KV 时,额外安装 GDN 持久状态包(循环矩阵、卷积历史与初始化语义)把 NLL 从 3.115 降到 2.368,降低 0.7473 nats/token(95% CI [0.6921, 0.8047]),64 篇文档全部改善,约消除 KV-only 超额 NLL 的 80%(均值 79.7%、中位数 80.2%)。 此前跨模型 KV 翻译、隐藏状态消息传递、外部记忆复用与同模型循环缓存复用已有工作,但据作者所述,尚无先例展示不同规模注意力—循环混合模型之间、且不做目标前缀重放的持久循环推理状态迁移。 冻结的教师强制 NLL 对比,64 篇 PG19 文档、4,096 token 前缀、每篇 64 个评分目标,文档为统计单位,10,000 次配对文档自助重采样;同模型恢复检查在两种模型、四种长度、各 16 个上下文上达到 top-1 一致率 1.0 与最大绝对 logit 差 0。
直接复用源模型的循环与卷积状态优于所测试的学习式 GDN 翻译:在翻译 KV 不变时,直接复制把 NLL 从 2.368 降到 2.291(改善 0.077 nats);在 32 篇文档的组件析因中,翻译循环状态反而使 NLL 上升 0.0280(CI [0.0104, 0.0475]),最终选定的 TDD 路径在 64 篇留出文档上超额 NLL 为 0.105,优于 TTT 的 0.134。 学习式循环映射在验证集上的归一化状态重建误差更低(0.5037 对直接复制的 0.6732),但行为上更差,说明张量重建误差不足以预测跨模型续写质量,这与 CacheBridge 关于注意力敏感加权的观察方向一致。 两个独立实验:实验一在 128 篇 FineWeb-Edu 文档上拟合、32 篇验证、64 篇 PG19 测试;实验二在 32 篇全新文档上做八格组件析因、64 篇全新文档做主要测试,均排除实验一的划分身份与文本哈希。
一个仅 434,176 个可训练参数、序列化 1.90 MB 的秩 4 修正(身份锚定、两个语言模型冻结)把交接续写损失从 2.018 降到 1.989,超额 NLL 从 0.105 降到 0.076,配对改善 0.0290 nats/token(CI [0.0228, 0.0354]),消除剩余原生差距的 27.5%(CI [22.4%, 33.9%]),JS 散度 0.022,NCR 0.918,top-1 一致率 0.864,且显著优于继续推理的 4B(2.042)。 这给出一个直观的行为端点:接收方在处理零个历史前缀 token 的情况下,比读过前缀的源模型更好地预测观测续写;修正的层相对残差范数中位数仅 0.0264、最大 0.0440。 冻结的 64 篇留出文档、教师强制续写、配对文档自助区间;该结果通过协议的全状态门(FULL_STATE_HANDOFF),但未通过更严格的近原生门(超额 NLL 0.076 > 0.05、NCR 0.918 < 0.95、top-1 0.864 < 0.90),因此条件性的 16K 分支未运行。
错误供体对照显示接收方确实使用了文档特定的转移状态:旋转完整供体状态后,实验一中正确全状态比打乱状态好 0.948 nats/token(CI [0.878, 1.022]),实验二中修正状态比打乱状态好,打乱后 NLL 3.178 甚至差于空 9B 的 2.842。 结合固定 KV 的主要对照,这些控制支持“转移的不只是注意力 KV”,但打乱改变的是完整供体状态,因此不能单独把上下文特异性定位到循环矩阵或某个具体保留事实。 等长文档间旋转、无自供体;实验一与实验二各自独立执行,并配有冻结的续写时间表与状态跟踪诊断。
启示与展望
该结果适用于一个方向(4B→9B)、一个几何精确匹配的 Qwen3.5 Base 模型对、4K 前缀与每篇 64 个教师强制目标,且接收方处理零个历史前缀 token;它使“模型族可被有意训练以保持持久状态几何与功能坐标兼容、从而暴露稳定切换接口”这一设计方向值得测试,也让读者理解混合模型的推理状态不止 KV。作者指出最具决定性的后续测试是无约束自由生成与在独立模型对上的复现,几何不匹配是更难的后续测试。
作者列出的开放问题包括:自由生成下小状态误差是否会累积、兼容性是否为该 Qwen 兄弟对特有、几何不匹配或不同更新动力学是否会破坏兼容性、共享预训练与训练配方是否促成该结果。原始主要对照未把循环矩阵与卷积历史、初始化语义分开,且冻结路径拒绝只激活一个 GDN 组件,因此独立分离 R 与 C 需要另行验证的干预。自助不确定性以冻结模型、拟合映射、选定修正与语料流程为条件,不覆盖训练种子或模型对变化;判定后的组件移除复用测试文档,属探索性。计时表未计入翻译过程、序列化 I/O、模型加载、批处理与调度,因此不构成端到端生产基准。本总结基于所加载的全文证据包,未运行任何模型评估或重新拟合。
