跳到主要内容
返回时间线
bioRxiv来源发表:

面向全人源重链抗体的专用基础模型:HCAbLM 学习序列与功能语法

核心概要

该工作先在不依赖任何 HCAb 训练模型的情况下刻画全人源重链抗体(HCAb),发现其与常规人源 VH 结构域相比存在可重复的分布偏移,主要集中在 CDR1/2、CDR3 结构以及(在有支持时)一个受限的框架区,而非广泛的框架重塑;据此研究者构建了 HCAbLM——据其所述为首个专门在大规模全人源 HCAb 库上预训练的基础模型,使用来自 73 只独立免疫 HCAb 小鼠的 3180 万条序列,该模型学到区别于常规抗体语言模型的区域选择性序列兼容性先验,其冻结表征可迁移到实验测得的 SEC 纯度、HIC 行为和热稳定性,并在分组内部验证与回顾性跨项目评估中得到检验。

Source-provided article image: A foundation model learns the sequence and functional grammar of fully human heavy-chain-only antibodies
Fig. 1 ·

Fig. 1 | Molecular premise and evidence chain. a, A conventional IgG pairs a heavy-chain variable domain (VH) with a light-chain variable domain (VL), whereas a fully human HCAb lacks CH1 and a light chain, leaving the surface normally contacted by VL solvent-exposed. b, Schematic topology of the compared variable domains in IMGT framework (FR1–FR4) and complementarity-determining (CDR1– CDR3) regions. Dots indicate positions differing from the assigned V germline; the

bioRxiv · 第 4 页

深度剖析

研究首先以模型无关的方式刻画了全人源 HCAb 与常规人源 VH 结构域的差异,发现分布偏移主要局限于 CDR1/2、CDR3 结构以及在有支持时一个受限的框架区,而非广泛的框架重塑。 此前对抗体语言模型的讨论多基于通用抗体库,该工作把 HCAb 这一特殊抗体格式的序列特征作为独立于 HCAb 训练模型的分析对象,提供了来源感知的比较证据。 基于来源感知的比较,报告为可重复的分布偏移,并明确其定位范围;原文未给出具体统计量或样本规模细节。

研究者开发了 HCAbLM,据其所述为首个专门在大规模全人源 HCAb 库上预训练的基础模型,训练数据为来自 73 只独立免疫 HCAb 小鼠的 3180 万条序列。 与从大型天然抗体库学习的通用抗体语言模型不同,HCAbLM 采用库特异性的预训练策略,回应了通用表征是否捕捉特殊抗体格式约束的问题。 以明确的序列规模(3180 万条)和独立免疫小鼠数量(73 只)作为数据基础,属于方法层面的贡献。

HCAbLM 学到了区别于常规抗体语言模型的区域选择性序列兼容性先验,其冻结表征可迁移到实验测得的 SEC 纯度、HIC 行为和热稳定性。 该工作把预训练表征与实验可测的功能属性(纯度、疏水相互作用行为、热稳定性)联系起来,而不仅是序列层面的拟合。 在分组内部验证与回顾性跨项目评估中检验冻结表征的迁移能力,属于回顾性评估而非前瞻性实验验证。

研究提出库组成(repertoire composition)是特殊抗体格式基础模型的重要生物学设计变量。 把数据来源的生物学背景从单纯的训练资源提升为影响模型表征的设计选择。 该结论由上述模型无关的分布偏移与库特异性预训练结果共同支持,属于基于本工作的推论。

启示与展望

该工作面向全人源重链抗体这一特定格式,其结论适用于以 HCAb 库为训练来源、并关注 SEC 纯度、HIC 行为与热稳定性等实验可测属性的场景;对常规抗体或其他特殊格式是否同样成立,原文未作说明。

原文为摘要级文本,未提供图表、具体统计量、样本划分细节或评估指标数值;因此 HCAbLM 表征迁移的实际效应大小、分组内部验证与回顾性跨项目评估的具体设计,以及区域选择性先验的生物学解释,仍是读者需要进一步关注的问题。

来源