ABCP_finder:基于Transformer嵌入的抗乳腺癌肽预测框架
核心概要
该工作提出ABCP_finder,一个以预训练蛋白语言模型(ProtBERT与ESM2)嵌入加多层感知机分类器为核心的抗乳腺癌肽(ABCP)预测框架,采用CD-HIT在30%序列一致性与80%覆盖度下做同源感知的训练-测试划分以降低数据泄漏,其中ProtBERT取得93.82%准确率、86.88%召回率、90.59% F1、0.8618 MCC、96.67% AUC与0.0633 Brier分数,并据校准分析选定0.7概率阈值识别高置信ABCP,外部用xDeep-AcPEP验证显示被预测为ABCP的未知肽具有较好IC值。
深度剖析
提出首个专门面向抗乳腺癌肽预测的计算框架ABCP_finder,用预训练Transformer蛋白语言模型嵌入(ProtBERT、ESM2)表示肽序列,再由多层感知机完成分类。 相对以往依赖实验手段筛选ABCP的高耗时高成本路径,该工作把任务形式化为一个基于语言模型嵌入的监督分类问题,并明确以ABCP为专门预测对象。 文中给出完整流程描述:正负数据集构建、两种预训练模型嵌入、MLP分类,并报告了具体性能指标,属于方法层面的自洽报告。
在测试的模型中ProtBERT表现更优,在类别不平衡条件下仍取得93.82%准确率、86.88%召回率、90.59% F1、0.8618 MCC、96.67% AUC与0.0633 Brier分数。 该结果给出了ProtBERT与ESM2在同一任务上的可比较表现,并同时报告了召回、MCC、AUC与Brier分数等区分度与校准相关指标。 指标数值直接来自文中报告;MCC与Brier分数同时给出,说明评估兼顾了不平衡数据下的判别能力与概率校准。
采用CD-HIT在30%序列一致性与80%覆盖度下的同源感知训练-测试划分,以降低数据泄漏并实现更贴近真实的评估。 相比常规随机划分,同源感知划分把序列相似性控制纳入评估设计,使性能数字更能反映对新序列的泛化情形。 划分策略与阈值在文中明确给出,属于可复现的评估设计说明。
通过校准分析选定0.7概率阈值用于识别高置信ABCP,并用xDeep-AcPEP做外部验证,显示被ABCP_finder预测为ABCP的未知肽具有较好的IC值。 该工作把概率校准与阈值选择纳入预测流程,并引入独立工具对未知肽的预测结果做生物学相关性层面的外部检验。 阈值选择有校准分析支持;外部验证为跨工具的一致性观察,文中以IC值表现作为生物相关性的支持证据。
启示与展望
该框架面向抗乳腺癌肽的大规模计算筛选场景,适用于希望在海量候选肽中优先排序高置信ABCP的研究与药物早期发现流程;其评估建立在自建正负数据集、CD-HIT 30%一致性/80%覆盖度的同源感知划分,以及0.7概率阈值之上,因此结论适用于这一设定下的预测排序,而非直接的临床或体内疗效判断。
外部验证以xDeep-AcPEP的IC值表现作为生物相关性支持,其覆盖的未知肽范围与实验验证深度在文中未展开;此外,正负数据集的构成细节、ProtBERT与ESM2之外模型的表现,以及0.7阈值在不同数据分布下的稳定性,都是读者可继续关注的方向。
