跳到主要内容
返回时间线
bioRxiv来源发表:

ModelSEED 生物化学数据库 2026 更新:多源热力学数据的证据分级

核心概要

该更新将 ModelSEED 生物化学数据库扩展至约 46,000 个化合物、约 56,000 个反应和约 37,000 个代谢结构,把热力学数据从两个来源扩展到四个来源(基团贡献法、eQuilibrator 3.0、dGPredictor 与实验值)并各自保留其不确定度,对约 33,000 个反应按证据强度给出金、银、铜三级评分,同时发布由大语言模型集成给出的反应方向预测,并用新的冲突消解流程记录结构来源间的取舍。

AI-generated editorial illustration: The ModelSEED Biochemistry Database, 2026 update: grading multi-source thermodynamics

深度剖析

数据库规模与来源结构发生变化:化合物增长 34%、反应增长 55%,反应增长现由 MetaCyc、KEGG 与新整合的 Rhea 三个主库分担,其中 Rhea 带来 8,339 个其他来源没有的反应。 相较 2020 版以两个来源为主,本次新增 Rhea 反应并明确各来源的独有份额与完整度差异(MetaCyc 90%、KEGG 76%、Rhea 66% 的反应可被赋予完整结构)。 基于对三个主库反应计数与完整反应比例的统计(图 1),并说明 Rhea 通过 ChEBI 标识化合物,其完整度依赖 ChEBI 结构。

热力学层改为多源并列发布,每个来源保留自身不确定度与方向推断,并暴露来源间的一致与分歧。 2020 版合并两个来源并倾向单一数值,本次携带四个来源记录,且指出三个预测器报告的不确定度尺度相差超过一个数量级(中位数 0.63、10.41、17.01 kcal/mol)。 以实验锚定反应校准各来源误差:eQuilibrator 低估自身误差(仅 28.7% 落在其一个标准差内),基团贡献法高估(73.6% 落在一个标准差内),dGPredictor 标度最好(均方根 1.15,87.9% 落在一个标准差内)。

提出金/银/铜证据分级,把来源自评置信度与跨来源一致性结合为可解释的可靠性标签。 分级不是直接采用来源报告的不确定度,而是先用等渗回归把不确定度校准为概率,再用加权比较判断来源间是否相互印证或相互矛盾。 33,099 个反应被分级(金 3,434、银 18,388、铜 11,277);在仅用预测器重新分级时,806 个锚定反应中金级子集有 96.9% 落在测量值 2 kcal/mol 以内,银级为 91.3%。

以 LLM 集成(三名预测者、一名审计者、一名裁决者)仅凭反应名称与化学计量式预测方向,作为热力学规则之外的补充视角。 该预测覆盖约 46,000 个反应,弃权率约 2%,远高于热力学规则愿意给出方向的反应比例,且不参与证据分级。 作者报告集成返回的置信度与热力学相比并不能区分正确判断,因此不适合作为下游筛选依据;其输出与提示词一并存入仓库供审阅。

启示与展望

该数据库面向跨物种的通用生物化学,所有数值统一报告在 pH 7.0、离子强度 0.25 M、pMg 3.0、298.15 K 条件下;转运反应仅按化学计量与能量评分,不使用膜电位或 pH 梯度估计。分级结果适用于基因组尺度重建、通量分析与途径设计等需要判断反应方向可靠性的场景,金级与银级被建议用于代谢模型,铜级被建议留待人工复核。

三个预测器报告的不确定度尺度不可直接比较,分级依赖对实验锚定的校准,因此锚定集之外的化合物与反应其分级含义需要谨慎解读。LLM 集成的置信度未被证明能区分正确判断,其方向预测与热力学规则的关系仍属开放问题。结构冲突报告显示仍有约 1,000 个化合物存在结构差异、56 个化合物存在元素组成差异,这些条目在具体建模中的影响值得关注。此外,本次加载的文本为预印本,图表以文字描述形式呈现,若需核对具体数值分布仍应查阅原始图表。

来源