学习潜在蛋白质语言:PLLM 将计算缩放斜率提升至 0.038,SLL 使验证困惑度降低 34%
核心概要
该工作提出两种可学习的离散潜在蛋白质语言:序列侧的 PLL 基于冻结的 ESM-2 编码器构建 4096 状态上下文词表,结构侧的 SLL 在 GCP-VQVAE Lite 上加入序列与置信度辅助监督并保持可解码为骨架坐标;在匹配的下游训练下,PLLM 的拟合计算缩放指数为 0.038,高于氨基酸自回归模型的 0.020,且将低于 1.5 比特残基组成熵阈值的样本比例降低 54%;用 SLL 替换原分词器使序列到结构预测的最佳验证困惑度降低 34%。
Figure 1: PLL construction. Stage 1 trains a vector-quantized variational autoencoder (VQ-VAE)-style latent reconstructor for frozen ESM-2 representations. Stage 2 finalizes PLL as a VQ-RAE by freezing the latent encoder and codebook and training a reinitialized transformer decoder with a linear residue-classification head.
arXiv深度剖析
PLL 将蛋白质序列重新字母化为每残基一个离散码的上下文语言,在冻结 ESM-2 表示空间中重建接近原始表示,并能高精度恢复氨基酸身份。 与直接使用氨基酸符号不同,PLL 的码本可区分上下文状态,同时保持序列长度与残基对齐,且解码不依赖 ESM-2。 Stage 1 达到中位 NMSE 0.044、重建 KL 0.003、余弦相似度 0.970;Stage 2 在 UniRef50 验证集上达到 99.81% 微平均残基恢复,所有标准氨基酸类别恢复率高于 99.17%。
在匹配的下游序列训练下,PLLM 的拟合计算缩放指数高于氨基酸自回归模型,并在无条件生成中显著减少低复杂度漂移。 该比较在相同 UniRef50 序列、token 预算与优化设置下进行,仅改变目标表示,因此将缩放与漂移差异归因于完整 PLL 目标表示。 PLLM 拟合指数 0.038 对氨基酸模型 0.020,约 1.9 倍更陡;在温度扫描中,低于 1.5 比特熵阈值的样本比例由氨基酸模型的 43.0% 降至 PLLM 的 19.9%。
SLL 在保持骨架可解码的同时提升结构码的语义效用,并改善自回归序列到结构预测的目标可预测性。 在固定 GCP-VQVAE Lite 架构与语料的前提下,仅改变分词器目标并加入辅助头,使结构码携带序列与置信度信息。 组合配方在监督 PST 上较基线提升功能位点 AUROC 24.2%、理化 Spearman 35.0%;匹配的 Prot2Token 式设置中仅替换目标分词器使最佳验证困惑度降低 34%,并以训练轮次计快 49% 达到可比训练损失区间。
SLLM 可用于序列到结构预测,并可通过潜在 token 置信度进行推理时扩展以提升候选质量。 将 DeepConf 式置信度选择与 token 空间共识结合,在坐标解码前筛选候选,无需外部结构质量指标。 在 CASP14/15/16 调参集上,DeepConf 选择将平均 TM-score 从单样本 0.564 提升至 0.589,oracle best@64 达 0.667;在 CAMEO-2024 上从 0.725 提升至 0.754,oracle best@256 达 0.825。
启示与展望
该工作面向单链单体蛋白质,序列侧使用 UniRef50,结构侧使用 AFDB 代表结构与 AFDBUniRef50 结构 token 语料;PLL 与 SLL 分别独立预训练,序列到结构预测以 E1 序列表示为条件。对希望将自回归配方用于蛋白质生成的研究者,PLL 提供了可解码的序列目标语言,SLL 提供了可解码的骨架目标语言,并展示了在潜在 token 空间进行候选采样与置信度选择的可行性。结果适用于所报告的单链、匹配训练设置与所评估基准。
缩放指数基于零偏移幂律拟合的下损失前沿,未报告拟合置信区间或对不可约损失项的敏感性;氨基酸-PLL 比较评估的是完整 PLL 目标表示,未分离 ESM-2 语义、向量量化、词表扩展或学习分词器变换的各自贡献。生成基准跨预训练系统比较,训练数据、模型规模与训练模态并不匹配。SLLM 在自洽质量指标上低于专门骨架生成器,其优势体现在多样性与新颖性。多链复合物、联合 PLL-SLL 共生成以及连续目标生成或 ESM-2 微调蒸馏等替代方案尚未评估。
