跳到主要内容
返回时间线
arXiv来源发表:

无限参数 LLM:从实时数据生成并适配权重

核心概要

该工作提出“无限参数 LLM”架构:用一个紧凑超网络把运行时提供的数据(事实、指令、示例)编码为低维隐码,再由该隐码生成对共享基础前馈网络的低秩加性调制,从而在不存储专家库的前提下按 token 生成“专家”,并进一步对隐码维持一个贝叶斯信念、随会话在线更新,使有效权重在会话中持续演化;作者同时给出评估协议,把“把知识放进权重”与“把知识放进提示”在同等预算下直接对比。

Source-provided article image: Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data
Figure 1 ·

Figure 1: Three regimes for turning data into model capability, ordered by how often the model’s weights change and how recent the data they learn from is. Pre-training and post-training (SFT, RLHF) both update the weights offline, in batch, and leave them frozen thereafter; they differ mainly in the data they use and how often they run. Live-learning, the regime this work targets, updates a generated low-rank code continuously, at inference, on the interaction data — facts, corrections, outcomes — that the others cannot reach in the loop, and keeps adapting rather than freezing. In-context learning and retrieval (bottom) also act at inference, but they leave the weights unchanged and carry the data in the prompt, where it is re-read every request and then discarded. The regimes are complementary, not competing: live-learning does not replace pretraining (§ 4), it reaches the data pretraining and prompting leave on the table.

arXiv · 第 3 页

深度剖析

提出一种生成式专家架构及其设计空间:共享基础 FFN 的权重通过由隐码驱动的生成式低秩增量变为动态,不存储任何专家库。 相对存储式 MoE(如 DeepSeek-V3 的 671B 参数、每 token 激活 37B)以及无库但仍冻结的 μMoE、∞-MoE,这里把“专家”从被选中改为被生成;作者用“权重从何而来”和“生成后是否继续变化”两条轴把 ∞-MoE、μMoE、DFC、HyperMoE、MoEGen 等定位为在该结构不同轴上的偏离。 属于架构与方法层面的设计论证,文中给出公式 W(z)=W0+B(z)A(z)ᵀ 与每 token 计算量 O(r(d+h)) 相对基础 FFN 的 O(hd) 的对比,但未报告训练或推理实验结果。

给出“无限参数”的精确表述:专家空间是无界的连续生成族,每 token 一个新专家,并随适配在时间上延展,同时明确区别于“无界知识”。 作者强调网络可存储的信息受参数量约束(引 Allen-Zhu 与 Li 的约每参数两比特),因此“无限”指的是可编译出的有效权重与行为的无界集合,而非无界存储;并以贝叶斯非参数专家混合作为类比。 概念性论证,依赖对既有容量结论的引用与对自身主张范围的界定,没有新的实证测量。

把在线适配表述为对隐码的信念更新,这是与一次性权重生成器最核心的区别。 Text-to-LoRA、SHINE 等一次性生成器读一遍上下文就冻结适配器,是回合级且无记忆的;这里把隐码当作带先验的隐变量,用摊销的递归贝叶斯滤波在三种节奏(上下文级、每回合、每 token)下更新,并带不确定性门控的保留机制,把上下文学习、一次性超网络、持续学习后验与快速权重定位为同一概率框架内的不同点。 方法层面的形式化与定位论证;作者明确指出“贝叶斯”是关于校准后验的实证主张,并说明精确滤波恢复、摊销差距与后验精度校准属于留待未来工作的部分。

提出一套评估协议,直接针对该设计真正面对的比较:在同等预算下,把知识与行为放进权重是否优于放进提示。 主要基线是提示家族(上下文学习与检索),适配基线是一次性权重生成器与点估计的测试时训练,存储库 MoE 作为参照点;作者还把权重生成器已知的“记忆而非泛化”失效模式列为一等评估关注点。 协议设计层面的贡献,文中未给出协议执行后的结果数据。

启示与展望

该设计面向部署阶段的会话内适配:适配被界定为有界、低维且可逆,作者明确表示它不废除容量定律、也不替代预训练,而是触及预训练与提示都触及不到的运行时数据。适用对象是标准 decoder-only transformer 中选定层的 FFN 子层,注意力与基础权重全程冻结;编码器从轻量读出头到复用骨干再到完全独立超网络构成一条“占用与读取保真度”的权衡轴,具体落点被留作经验问题。

读者仍会关注:摊销滤波能否恢复精确滤波的行为、摊销差距有多大、后验精度是否校准;不确定性门控与过程噪声带来的保留与遗忘在长会话中是否稳定;编码器规模与读取保真度之间的最优点落在何处;以及权重生成器已知的“记忆而非泛化”倾向在该架构下是否被缓解。此外,本次可读文本在方法部分被截断,图 4、第 3.5 节的具体架构选择与第 4 节评估协议细节未能读到,因此关于具体超参数、基座选择与实验设计的描述只能以文中已出现的表述为限。

来源