AmyloCore-ML 用蛋白质语言模型从序列预测淀粉样纤维核心区,AUROC 约 0.88 并优于 CrossBeta 与 AggrescanAI
核心概要
该工作基于 Amyloid Atlas 中实验解析的纤维结构,把有序残基标为核心、把同一蛋白中未解析残基作为匹配的非核心对照,用理化描述符与 ESM-2、ANKH、ProtT5 等蛋白质语言模型嵌入编码,并以按蛋白分组的交叉验证评估,构建出序列层面的淀粉样纤维核心倾向预测器 AmyloCore-ML;蛋白质语言模型一致优于理化描述符,最佳模型 AUROC 约 0.88、AUPRC 约 0.85,锁定全长蛋白扫描中 ESM-2/ExtraTrees W21 达到 AUROC 0.833、AUPRC 0.751、平均峰距 12.4 个残基,对比基准中指标优于 CrossBeta 和 AggrescanAI,并以 Google Colab 笔记本形
workflow is presented in Figure 1.
bioRxiv · 第 2 页深度剖析
该工作提出 AmyloCore-ML,一个直接从序列给出残基级淀粉样纤维核心区预测的框架,目标是刻画真正被纳入纤维结构的那部分残基,而非泛泛的聚集倾向区域。 既有预测器多估计聚集倾向区域,这些区域未必对应实际疾病相关纤维结构中出现的残基;该工作把预测目标改为结构上被纳入的核心区。 标签来自 Amyloid Atlas 中实验测定的纤维结构,有序残基记为核心,同一蛋白中未解析残基作为匹配对照,属于基于实验结构的监督设定。
蛋白质语言模型嵌入在核心区识别上一致优于理化描述符,最佳模型 AUROC 约 0.88、AUPRC 约 0.85。 该比较在同一评估框架下同时考察理化描述符与 ESM-2、ANKH、ProtT5 三类嵌入,给出了表示方式之间的相对表现。 评估采用按蛋白分组的交叉验证,避免同一蛋白的残基同时出现在训练与测试中;摘要报告的是 AUROC 与 AUPRC 指标。
在锁定全长蛋白扫描中,模型能够定位实验确定的核心区,ESM-2/ExtraTrees W21 取得 AUROC 0.833、AUPRC 0.751,平均峰距 12.4 个残基。 该扫描把评估从残基分类推进到全长序列上的核心区定位,并给出峰位与真实核心之间的距离度量。 结果来自锁定模型的全长蛋白扫描,报告了 AUROC、AUPRC 与平均峰距三项指标。
在对比基准中,该预测器的性能指标优于 CrossBeta 与 AggrescanAI,并以交互式 Google Colab 笔记本提供,无需本地安装或专用计算设施。 除指标比较外,该工作把可用性作为交付的一部分,降低了序列层面纤维核心预测的使用门槛。 比较基于摘要所述的性能指标;可用性以公开的 Colab 笔记本形式体现。
启示与展望
该框架面向需要从序列判断淀粉样纤维核心区的研究者,适用于以实验解析纤维结构为参照的蛋白体系,输出为残基级核心倾向,并可在全长蛋白扫描中给出核心区位置。由于以 Google Colab 笔记本交付,使用者无需本地安装或专用计算设施即可运行,这使其适合作为筛选与假设生成的工具,用于在实验解析结构之外的新序列上提出核心区候选。
当前可见文本为摘要,未包含图表与数据表,因此训练与测试所用蛋白数量、核心与非核心残基的类别比例、各嵌入与分类器的完整对比表、以及 CrossBeta 与 AggrescanAI 比较所用的具体设置均无法从文本确认。平均峰距 12.4 个残基在更长或更短的核心区上如何变化,以及该预测器在缺乏实验结构的蛋白上表现如何,仍是值得关注的开放问题。
