跳到主要内容
返回时间线
bioRxiv来源发表:

OmniTCR:统一T细胞受体识别预测与条件序列生成的基础模型

核心概要

该研究提出OmniTCR——一个1.13亿参数的自回归基础模型,在3.28亿条格式化人类免疫序列记录上预训练,通过序列类型标记与互补的组分顺序,将单个TCR链与部分或完整的TCR-pMHC关联数据联合学习,从而在同一模型中同时完成TCR识别预测与条件序列生成,在未见表位上取得肽-TCRβ识别AUPRC 0.7009、TCR-pMHC相互作用预测AUPRC 0.8235,并在11个独立泛癌队列中以平均AUROC 0.9436区分癌症与健康免疫组库。

AI-generated editorial illustration: OmniTCR: a foundation model unifying T cell receptor recognition prediction and conditional sequence generation

深度剖析

OmniTCR将TCR识别预测与受体生成统一到一个自回归基础模型中,而非像传统做法那样分别建模。 原文指出识别预测与受体生成“traditionally modelled separately”,导致庞大的TCR序列集合与较小的TCR-peptide-MHC数据集相互脱节;该工作用序列类型标记和互补组分顺序把两类任务与两类数据接在一起。 以1.13亿参数模型在3.28亿条格式化人类免疫序列记录上预训练为方法基础,属于模型与预训练规模层面的证据。

在未见表位上,OmniTCR的识别预测表现高于所评估的最强对比方法。 原文报告肽-TCRβ识别AUPRC为0.7009、TCR-pMHC相互作用预测AUPRC为0.8235,分别超出最强对比方法0.3396和0.3451。 证据来自“unseen epitopes”上的AUPRC指标及与最强评估对比方法的差值,属于基准评测层面的证据。

OmniTCR能够区分癌症与健康免疫组库,并在生成任务上取得最高的序列恢复率。 原文报告在11个独立泛癌队列上平均AUROC为0.9436,并在内部与外部生成基准上取得最高序列恢复;此外结构建模支持所选pMHC条件化CDR3β候选的合理性。 证据包括11个独立队列的AUROC、内部与外部生成基准的序列恢复,以及针对部分候选的结构建模支持。

启示与展望

该工作面向计算免疫学与受体设计场景,适用于人类免疫序列数据,并覆盖单个TCR链以及部分或完整的TCR-pMHC关联;其识别预测结果针对未见表位,组库判别结果针对11个独立泛癌队列,生成结果针对内部与外部生成基准。对希望在同一框架内同时进行TCR识别预测与条件序列生成的研究者与设计者,这一模型提供了可复用的基础。

当前可获取的文本为摘要层面的概述,缺少图表与补充材料,因此预训练数据的具体构成、各基准的对比方法细节、结构建模的评估方式,以及生成候选的实验验证程度,仍是读者需要进一步查看原文才能确认的开放问题。

来源