用AI设计并表征抗体:三项工作覆盖结合位点选择、亲和力排序与成药性预测
核心概要
该文介绍Amazon Bio Discovery团队的三项工作:MochiBind以序列为基础、通过成对比较与TrueSkill聚合实现跨抗原的抗体-抗原结合强度排序,在四个留出抗原上成对准确率高于所有基于结构的基线,并在CPU上约13秒完成20万对打分;CA-MAP以文本提示中的示例抗体捕捉批次偏移,在模拟批次效应下保持0.99相关性而常规微调降至0.58,且仅约18.2万可训练参数、推理约快200倍;第三项工作用热点推荐智能体协调七种生物信息学工具、三种生成模型各产出9.6万个设计,经酵母表面展示筛选后116个候选均不与无关对照蛋白结合,其中46个被判定为强结合体。
深度剖析
MochiBind把结合亲和力预测从回归绝对数值改为判断同一抗原下两个抗体谁结合更紧,并用TrueSkill把成对比较聚合成候选池的全局排序,全程不需要结构输入。 文中指出,多数亲和力预测器在训练中出现过的抗原上预测绝对亲和力,且测试集很少或没有非结合体;作者调研七项先前研究后认为没有一项满足训练通用预测器所需的全部条件,因此重新定义了任务。 使用AlphaBind数据集,覆盖TIGIT、PD-1、HER2和SARS-CoV-1 RBD四个抗原系统,每个约3万个经实验表征的变体,抗原间成对序列相似度接近零;采用严格的跨抗原协议,训练两个抗原、验证第三个、测试第四个并轮换。MochiBind在四个留出抗原上成对准确率均高于所有基于结构的基线,平均超出最接近的竞争者近10%;在四个抗原上检索准确率最高,在四个中的三个上检索精确率最高;CPU上约13秒完成20万对抗体打分,推理速度提升超过100倍。
CA-MAP把示例抗体的实测性质放进提示上下文,使模型在推理阶段自行校正批次偏移,无需重新训练。 文中指出,在单一实验室数据上微调的模型会悄然继承该实验室的批次偏移;而仅用单一来源数据训练的模型可能学会忽略示例、只依赖查询序列。作者提出AB-context-aware训练策略,对上下文性质和期望答案施加同一个隐藏随机变换并在每个提示中重新采样,使该变换只能从上下文中恢复,从而迫使模型使用上下文。 在微调的领域多模态大模型TxGemma上预测疏水性:无批次效应时标准微调与AB-context-aware表现相当,与真值的Spearman相关系数为0.99;在0–0.3范围的模拟加性批次效应下,标准微调降至0.58,而上下文感知模型保持0.99。CA-MAP在876,898条抗体重链、六种成药性性质的合成数据集上训练,在若干性质上Spearman相关(ρ)大于0.8,并在联合测试的四种性质上均优于微调的TxGemma基线;约18.2万可训练参数对TxGemma的4000万,推理每提示约快200倍。
CA-MAP可以查询训练数据中不存在的性质,并借助性质之间的相关性提升预测。 由于性质以文本指定,模型可被要求预测未在训练中出现的性质;文中报告在仅用两个目标性质作上下文时免疫原性预测ρ=0.25、正电荷异质性(PosCh)ρ=0.08,而把全部六种相关性质放入上下文后两者均达到ρ=0.73。 实验设定为在数据集六种成药性性质中只用四种训练、在另外两种(PosCh与免疫原性)上测试,属于留出性质的泛化测试;作者据此认为模型在利用成药性性质之间的相关性,并提示昂贵检测可能部分由较便宜的检测估计。
第三项工作把预测与生成模型串成端到端设计流程,并针对一个无实验结构、无公开抗体信息的新靶点获得实验验证的结合体。 靶点由Memorial Sloan Kettering Cancer Center的Dr. Nai-Kong V. Cheung实验室通过对患者肿瘤样本测序确定,属于促结缔组织增生性小圆细胞肿瘤(一种罕见且侵袭性的儿童癌症)的细胞表面靶点,满足位于肿瘤细胞表面、由特定遗传错误驱动、在健康组织中基本缺失三个条件;由于没有模板可移植、没有先前项目可做亲和力成熟,设计模型也不可能在训练中见过该抗原。 热点推荐智能体协调七种生物信息学工具(溶剂可及表面积、二级结构、疏水性、针对用户指定负靶点的序列唯一性、与NIAID免疫表位数据库50万条目的匹配、按Pfam类别注释结构域等),在SAbDab基准的抗体-抗原复合物上,于多样化留出集上约80%的情况下在前五个提议区域中至少命中一个真实表位残基,对本项目靶点提出八个热点区域。三种生成模型RFantibody、IgGM、mBER各产出9.6万个设计,经多目标Pareto过滤后优先选出10万个候选做实验筛选;经酵母表面展示与两轮分选过滤后存活的116个候选均不与无关对照蛋白结合,全部单独测定后46个被判定为强结合体。
启示与展望
这些结果面向抗体与纳米抗体发现场景:MochiBind适用于需要在候选池中排序、且靶点可能未出现在训练数据中的情形,其评测建立在四个抗原系统与跨抗原轮换协议之上;CA-MAP适用于同一实验室来源的示例抗体可获取、需要校正批次偏移并预测多种成药性性质的情形,其训练数据为合成数据集;端到端设计流程适用于无实验结构、无公开抗体信息的新靶点,其验证依赖酵母表面展示与两轮分选。对希望把预测模型接入自有实验流程的团队,这些工作提供了可参照的评测协议、训练策略与智能体编排方式。
读者仍会关注若干开放问题:MochiBind的跨抗原优势在四个抗原系统之外是否保持,以及相对排序在真实筛选池中的表现;CA-MAP在模拟批次效应之外的实测批次差异下是否同样稳定,以及留出性质预测的提升能否转化为对昂贵检测的实际替代;端到端流程中46个强结合体的亲和力水平、可开发性与后续优化空间,以及该流程在其它靶点上的可重复性。此外,本文为叙述性综述式介绍,未展开各论文的图表与完整实验细节,若需评估具体统计设定与消融结果,仍需查阅原始论文。
