跳到主要内容
返回时间线
arXiv来源发表:

用固定16位二进制码替代可训练输入嵌入表,32层语言模型在约16-17B token上取得2.36困惑度并移除67.1M参数

核心概要

该研究检验解码器语言模型是否必须为每个词元保留独立可训练输入向量:以V=65,536、d_model=1024为例,用固定16位二进制词元码加无参数平铺升维替换常规V×d_model输入表,移除67.1M可训练参数(约为未绑定学习输入基线的12.5%),三个训练种子下32层模型在约16-17B token上平均留出困惑度为学习输入基线2.44、规范二进制码2.36、仿射重编码2.39,作者说明这些描述性结果不构成统计优越性或等价性结论。

AI-generated editorial illustration: Language Models Without a Trainable Input Embedding Table: Learning from Fixed Minimal Binary Token Codes

深度剖析

论文提出用固定最小二进制词元码替代可训练输入嵌入表:对词表大小V,单射定长二进制标识需要K=⌈log2 V⌉位,并以无参数平铺方式升维到模型宽度。 相对常规为每个词元学习独立输入向量的做法,这里把输入侧词元身份改为固定编码,从而在V=65,536、d_model=1024设定下移除67.1M可训练参数,约为未绑定学习输入基线的12.5%。 证据来自论文自述的设定与参数量核算,以及三个训练种子的对照训练;文本未给出参数量核算的逐步推导细节。

在三个训练种子下,32层模型于约16-17B token上训练后,平均留出困惑度为学习输入基线2.44、规范二进制码2.36、仿射重编码2.39。 这提供了在相同规模与训练量下,固定二进制码与可训练输入表之间的描述性对照,并额外覆盖一种基于F_2^16上固定可逆仿射重编码的无表实现。 证据为三个种子的均值困惑度;作者明确指出这些描述性结果不建立统计优越性或等价性,因此应视为该设定下的观察而非确证。

用LM Evaluation Harness对发布的基座检查点做标准化评测,加入常识、知识与语言建模基准;三个论文检查点表现大体相近且随任务而异,外部SmolLM2参考模型在许多任务上明显更强。 这把输入表替换的影响从困惑度扩展到多类下游基准,同时通过外部参考模型给出性能定位,说明该方法的结论限于所研究范围。 证据为标准化评测工具下的检查点对比;文本未列出各基准的具体分数、任务清单或样本量。

论文结论限定于所研究范围:学习非平凡语言建模并不需要一张自由可训练的、按词元索引的输入表;Transformer仍学习连续表示,输出词表投影仍为标准且可训练。 这澄清了改动的边界——被移除的是输入侧词元索引表,而非模型学习连续表示的能力或输出侧投影。 该结论由作者基于上述训练与评测结果给出,并被作者自身限定为所研究范围,未主张普遍等价或优越。

启示与展望

该工作面向研究解码器语言模型输入侧设计的读者,适用设定为V=65,536、d_model=1024、32层、约16-17B token训练量,以及三个训练种子与LM Evaluation Harness标准化评测。它使后续工作可以在这一范围内考察固定二进制词元码与无参数升维的可行性,并比较规范二进制码与F_2^16上固定可逆仿射重编码两种变体。作者明确把结论限定为所研究范围,因此其意义在于说明该设定下不需要自由可训练的按词元索引输入表,而非给出跨规模、跨词表的通用替代方案。

作者已说明描述性结果不建立统计优越性或等价性,因此三个种子间2.44、2.36、2.39的差异应作为观察而非确证。文本未列出各下游基准的具体分数、任务清单与样本量,也未给出参数量核算的逐步推导,这些是读者评估迁移性时会关注的开放信息。外部SmolLM2参考模型在许多任务上明显更强,其训练设定与论文检查点的可比性在文本中未展开。结论被限定于V=65,536、d_model=1024、32层与约16-17B token的设定,向其他词表规模、模型宽度或训练量扩展仍属开放问题。

来源