Project Greenhouse 用 8 张 H100 从零预训练 3B 模型,微调出在 TREC DL 与 BEIR 上超过同规模开源权重基线、仅次于 GPT-6.1 Sol 的逐点重排器
核心概要
Project Greenhouse 提出把大模型训练建模为有向属性超图,并据此定义“完全开放且自主可控”的模型;作为首个里程碑,作者仅用公开数据集,先在 ClimbMix 上从零预训练一个 3.29B 参数的因果语言模型,再用 RLHN-250K 与局部对比估计(LCE)做监督微调,得到逐点重排器 Gaggle(base reranker)。该模型在 TREC DL 2019–2023 与七个 BEIR 集合上的平均 nDCG@10 超过所有对比的微调逐点与列表式重排器,TREC DL 上仅 GPT-6.1 Sol 更高。
Figure 1 : Validation loss on held-out ClimbMix during pre-training.
arXiv深度剖析
作者给出一个可复用的“完全开放且自主可控”判据:把 LLM 训练表示为有向属性超图,顶点是数据、权重等产物,超边是训练配方与配置,若某模型权重的全部上游顶点与超边都公开且不含专有依赖,则该模型完全开放且自主可控。 此前讨论多停留在“开放权重”层面,该形式化把开放性与可复现性明确区分开,并允许把数据消融、代码消融分别表示为尾顶点更少的超边、尾顶点相同而超边不同的对照。 这是概念性贡献,作者以 ClimbMix 与 MS MARCO 等公认数据集作为溯源边界,并明确承认边界划定包含判断成分。
仅用公开数据即可从零预训练出足以支撑竞争性重排器的骨干:3.29B 参数因果模型在 ClimbMix 上训练一遍(287B token),在 8 张 H100 上约 1,600 GPU 小时完成,CORE 0.458、MMLU 0.493、MMLU-Pro 0.178。 与主流做法不同,该骨干不依赖任何第三方开放权重初始化,也不需要指令微调、对齐、中期或后期训练、教师监督或合成数据。 评测代码经七个已发表 CORE 分数的参考模型校验,偏差在 0.011 以内;MMLU 与 MMLU-Pro 与标准评测框架偏差在 0.003 以内。作者也说明表 3 中各模型在数据、架构与配方上均不同,因此该表是定位而非单因素归因。
两步配方产出的 Gaggle(base reranker)在 TREC DL 上平均 nDCG@10 为 0.641,在 BEIR 上为 0.547,均高于所对比的全部微调逐点与列表式重排器;TREC DL 上仅 GPT-6.1 Sol(0.653)更高,BEIR 上与 Gemma-4(0.548)相当。 该结果说明,在逐点重排这一任务上,从零自训练的骨干“足够好”,无需以开放权重骨干作为起点;模型仅 3B 参数,却优于多个 7B–27B 的对比条件。 评测统一采用 top-100 BM25 候选与 nDCG@10,四个同配方微调试验的基准均值样本标准差约 0.001、单集合平均约 0.003,作者据此把该量级的差异视为实验噪声;模型汤由四次试验权重平均得到。
对照实验给出若干可操作的训练经验:更大的 RLHN-680K 数据把 TREC DL 均值从 0.641 提到 0.646;查询–段落–查询(QPQ)提示把 TREC DL 从 0.641 提到 0.647、BEIR 从 0.544 提到 0.551;LCE 优于逐点交叉熵(TREC DL 0.641 对 0.628,BEIR 0.544 对 0.528)。 这些对照在统一配方下比较了骨干、数据、注意力模式、提示、池化、自过滤与损失函数,并指出共享学习率对不同预训练权重尺度的骨干并不通用。 差异均与第 6.2 节测得的运行间噪声尺度对照;作者也说明 RLHN-250K 与 RLHN-680K 的对比同时改变了数据规模、来源分布与优化步数,无法单独归因。
启示与展望
该结果面向需要在有限算力下自行掌控训练全流程的研究组与组织:重排器可作为独立组件接入 BM25、稠密检索或外部搜索 API 之后的候选列表,也可在智能体搜索中用于筛选进入模型上下文的结果,或作为相关性判定器参与奖励与验证。作者把适用范围限定在信息获取这一子问题,明确不涉及通用推理、编码等能力,并说明初始系统很可能是专有组件与开放组件的混合体。溯源边界以 ClimbMix、RLHN-250K 等公认数据集为起点,作者承认这一划定包含判断成分。
作者自述若干开放问题:重排任务是否对现代 LLM 过于简单,从而使简单两步配方即可达到竞争性效果;完整智能体能力能否在有限算力下以完全开放且自主的方式实现,一个竞争性重排器并不等于一个竞争性智能体;数据集本身可能包含未披露的过滤、合成生成与标注决策,因此溯源边界需要更明确的声明;域外泛化尚未充分检验;此外,本文为快速解析版本,正文中的公式、图 1 至图 5 与部分表格数值未能完整呈现,涉及具体公式形式与训练曲线的细节需回到原文核对。
