Co-LMLM 将向量检索查询与下一词预测交错预训练,在 360M 规模上困惑度低于用 40 倍数据训练的模型,SimpleQA 表现与 gpt-4o-mini 相当并高于 Claude Sonnet 4.5
核心概要
该工作提出连续查询有限记忆语言模型(Co-LMLM),在预训练中把灵活的向量检索查询与下一词预测交错进行,并训练模型复制知识库返回的知识而非记忆它,采用联合训练知识外化 LLM、归纳其知识库并学习连续检索机制的可扩展方法;在多个模型规模的预训练中,Co-LMLM 在困惑度和事实精确度上均优于此前的知识外化模型和普通 LLM,在 360M 规模上困惑度低于用 40 倍数据预训练的模型,SimpleQA 验证表现与 gpt-4o-mini 相当且高于 Claude Sonnet 4.5。
Figure 1: Knowledge separation across three regimes. A standard LLM with RAG retrieves over external documents but keeps factual knowledge in its parameters ( left ); Rel-LMLM externalizes facts to a relational KB queried with an explicit decoded query ( middle ); Co-LMLM externalizes facts to an unstructured index, retrieved directly from the model’s hidden state ( right ). Bottom: some of the advantages and limitations of each regime.
arXiv深度剖析
提出 Co-LMLM:一种将灵活向量检索查询与下一词预测交错的语言模型,预训练目标是复制知识库返回的知识,而不是把知识记忆进参数。 相对此前的知识外化 LLM 与普通 LLM,该设计把知识使用从参数记忆转向检索后复制,作者将其定位为提升小规模性能、控制知识使用并增强模型透明度的路径。 摘要给出的是设计层面的主张与跨规模预训练对比结果,未在文本中给出具体数据集构成、检索查询形式或透明度度量方式。
提出一种可扩展的预训练方法,联合训练知识外化 LLM、归纳其知识库,并学习表达力强的连续检索机制。 把知识库归纳与连续检索机制的学习纳入同一预训练流程,而非在固定知识库上单独训练检索器。 摘要以“jointly trains”描述该流程,未提供训练阶段划分、知识库规模或消融实验细节。
在多个模型规模的预训练中,Co-LMLM 在困惑度和事实精确度两项指标上均优于此前的知识外化模型和普通 LLM。 相对既有知识外化路线与普通预训练路线,在两类指标上同时取得优势,而非仅在单一指标上改善。 摘要报告为跨多个模型规模的一致结果,但未列出各规模的具体数值、对比模型清单或评测协议。
在 360M 规模上,Co-LMLM 的困惑度低于用 40 倍数据预训练的模型,SimpleQA 验证表现与 gpt-4o-mini 相当,并高于 Claude Sonnet 4.5。 把知识外化路线的收益具体化为小模型对大数据量训练模型的困惑度优势,以及在 SimpleQA 上与更大专有模型可比的事实精确度。 摘要给出 360M 这一具体规模与 40 倍数据量对比,以及 SimpleQA 上的模型对照,但未给出具体分数、置信区间或评测样本量。
启示与展望
该结果面向的是预训练阶段的知识外化路线:适用于希望以较小模型规模获得较低困惑度与较高事实精确度、并希望知识使用可被检索机制控制与检视的研究与工程场景。摘要所述验证覆盖多个模型规模,其中 360M 规模给出了与 40 倍数据量模型的困惑度对比以及与 gpt-4o-mini、Claude Sonnet 4.5 的 SimpleQA 对照,因此该结论的适用范围以这些规模与评测设定为界。对读者而言,这意味着可以把 Co-LMLM 视为在预训练中引入连续检索查询与知识库复制的一种可选架构方向,用于替代或补充纯参数记忆。
摘要未说明知识库的规模、构建与更新方式,也未说明连续检索查询的具体形式与训练信号;困惑度与事实精确度的具体数值、对比模型清单、SimpleQA 的评测样本与判定方式均未在文本中给出;多个模型规模的具体取值除 360M 外未列出。此外,摘要未讨论推理时的检索延迟与知识库维护成本,也未说明该方法在知识库覆盖之外的领域或长尾事实上的表现。这些属于摘要层面尚未展开的范围,读者若需据此做架构选型,应回到正文核对实验设置与消融结果。
