跳到主要内容
返回时间线
arXiv来源发表:

RAGenome以检索式基因组语言模型把上下文扩展到13,312个核苷酸,基因查找MCC从0.45提升到0.60

核心概要

作者提出RAGenome,首个基于检索的基因组语言模型:它从100种脊椎动物全基因组比对中检索同源序列,丢弃占73%的空位标记,把预训练上下文扩展到13,312个核苷酸,比现有基于MSA的gLM长100倍;在基因查找任务上MCC由GPN-Star的0.45升至0.60,在致病变异优先级任务上AUROC为0.87,以168M参数和16,032 GPU小时同时兼顾长程与演化信号。

Source-provided article image: RAGenome: Scaling Retrieval-Based Genomic Language Models to Long Contexts
Figure 1 ·

Figure 1: Overview of the retrieval mechanism of RAGenome. For each query sequence, we retrieve aligned homologous sequences from a WGA and remove gap tokens, preserving the original alignment column of each retained token as its positional embedding. We then concatenate all sequences, add taxonomy embeddings to distinguish species, and restrict retrieval to a fixed budget B B using the phylogenetic tree. Tokens are then masked per clade, and the resulting sequence is passed to the RAGenome Transformer, which predicts the masked query tokens.

arXiv

深度剖析

RAGenome把基于MSA的基因组语言模型从约128–256个核苷酸的窗口扩展到13,312个核苷酸,同时保留显式的跨物种演化建模。 此前基于MSA的模型(GPN-MSA、GPN-Star)逐token处理整个比对,计算量随上下文长度和物种数同时增长,因而只能处理短窗口;RAGenome改为只保留比对中的核苷酸、丢弃空位标记,并用系统发育树在固定token预算内挑选物种。 作者统计所用100种脊椎动物WGA中73%的token为空位,而在最保守的5%区域空位比例为41%,说明全基因组预训练下丢弃空位可显著减少输入token;检索预算受GPU显存约束,最大设置下为80,000个token。

上下文扩展带来基因查找性能的大幅提升,而变异效应预测保持稳定,说明长程能力与演化信号可以并存于同一模型。 以往模型往往在长程任务与演化驱动任务之间取舍:MSA类模型擅长变异效应预测但短上下文,大规模gLM擅长长程但变异效应预测较弱。 基因查找MCC在上下文扩展到4,096时由0.47升至0.52,扩展到13,312时由0.54升至0.57;最终模型MCC为0.60,超过GPN-Star的0.45。变异效应预测在各预训练阶段保持平稳,最终AUROC为0.87。推理上下文长度消融显示,固定检查点下性能随推理上下文单调提升。

RAGenome以168M参数和16,032 GPU小时在两个任务上同时具备竞争力,缩小了与大规模gLM的差距。 NT-MS(2.5B参数、215,000 GPU小时)基因查找MCC为0.66但变异效应预测仅0.57;Evo2(7B参数、约1M GPU小时)两项分别为0.81和0.80;RAGenome以更小规模在两项任务上分别达到0.60和0.87。 对比基于论文表1所列参数、最大长度、是否使用MSA、GPU小时与两项指标;逐类混淆矩阵显示RAGenome在供体与受体剪接位点上明显优于NT-MS,NT-MS仅在内含子上更好,而内含子在测试集中占据更多核苷酸位置。

检索信息对两个任务都不可或缺,但两类任务对检索预算的依赖程度不同。 消融实验把检索预算从0变化到训练预算,直接检验检索机制本身的贡献,而非仅比较上下文长度。 无检索时性能崩溃(模型从未在无检索上下文下训练);加入少量预算后性能即大幅提升;变异效应预测在中等预算处饱和,基因查找则持续小幅提升至完整预算。

启示与展望

该工作面向需要同时建模跨物种演化关系与种内长程相互作用的基因组任务,例如基因查找与变异效应预测。适用前提是推理时可获得全基因组比对:模型以人类为查询物种、从100种脊椎动物比对中检索同源序列,因此当前适用于有人类参考比对覆盖的序列。作者指出,架构本身支持任意查询物种与比对,但迁移到新物种很可能需要额外预训练。代码与权重已公开,训练与评测数据均为公开数据,便于在相同设置下复现与扩展。

当前结论基于单一168M参数模型与人类查询物种,模型规模、数据规模与上下文长度的进一步扩展尚未验证。基因查找上RAGenome仍低于NT-MS(0.66)与Evo2(0.81),作者预期扩大规模可缩小差距,但这一预期尚待检验。逐类结果显示RAGenome在剪接位点上更强而NT-MS在内含子上更强,聚合MCC受测试集中内含子核苷酸占比影响,因此单看总分会掩盖类别层面的差异。此外,模型依赖推理时可用的比对,对无任何比对的序列或物种尚不适用。

来源