跳到主要内容

生命科学

193 条内容

  1. bioRxiv

    OmniTCR:统一T细胞受体识别预测与条件序列生成的基础模型

    该研究提出OmniTCR——一个1.13亿参数的自回归基础模型,在3.28亿条格式化人类免疫序列记录上预训练,通过序列类型标记与互补的组分顺序,将单个TCR链与部分或完整的TCR-pMHC关联数据联合学习,从而在同一模型中同时完成TCR识别预测与条件序列生成,在未见表位上取得肽-TCRβ识别AUPRC 0.7009、TCR-pMHC相互作用预测AUPRC 0.8235,并在11个独立泛癌队列中以平均AUROC 0.9436区分癌症与健康免疫组库。
  2. bioRxiv

    面向智能体AI的全基因组痘病毒-宿主互作筛选:以蛋白质语言模型精炼读出

    该工作提出ICARus——一个正例-未标注(positive-unlabelled)读出精炼框架,将蛋白质语言模型推导的蛋白质-蛋白质互作信息整合进全基因组RNA干扰筛选,以提升痘苗病毒-宿主互作及潜在抗病毒人类基因的发现,并将该筛选的原始与精炼读出作为面向智能体AI的社区资源公开。
  3. bioRxiv

    ABCP_finder:基于Transformer嵌入的抗乳腺癌肽预测框架

    该工作提出ABCP_finder,一个以预训练蛋白语言模型(ProtBERT与ESM2)嵌入加多层感知机分类器为核心的抗乳腺癌肽(ABCP)预测框架,采用CD-HIT在30%序列一致性与80%覆盖度下做同源感知的训练-测试划分以降低数据泄漏,其中ProtBERT取得93.82%准确率、86.88%召回率、90.59% F1、0.8618 MCC、96.67% AUC与0.0633 Brier分数,并据校准分析选定0.7概率阈值识别高置信ABCP,外部用xDeep-AcPEP验证显示被预测为ABCP的未知肽具有较好IC值。

已显示全部结果

第 20 页 · 当前显示 3 项