Evo 2 在五个二分类任务上展现上下文学习能力,短序列 F1 达 0.902,但千碱基尺度崩溃且 7B 反超 40B
核心概要
该研究在五个生物与人工序列的二分类任务上刻画了核苷酸级基础基因组语言模型 Evo 2 的上下文学习工作区间,发现短自然序列上表现稳健(miRNA 的 F1=0.902,毒素为 0.785),随序列长度增加而退化并在千碱基尺度崩溃,模型规模扩大无收益(7B 系统性优于 40B),困惑度难以预测准确率,并通过 logit-lens 与 Jacobian Scope 的机制可解释性分析提示存在预测—泛化权衡、模型可能追踪提示结构而非承载信号的序列内容。
Figure 1. Experiment structure. Schematic representation of the main steps composing the experimental structure, exemplified with a single Evo 2 model and microRNA sequences. Step 1, each class pool (class 0, miRNA; class 1, non-miRNA) is split independently into train and test sets. Step 2, per-class splits are merged into balanced train and test sets. Step 3, N examples per class from the train set are concatenated with a test set query, each encoded as a [sequence] →[buffer_run][label_run] pair. Frozen Evo 2 scores both candidate labels, and the lower-perplexity candidate is shown as the predicted class. Step 4, step 3 is repeated for each test query, with different values of N; predictions are then evaluated against ground truth with Macro F1.
bioRxiv · 第 4 页深度剖析
研究给出了 Evo 2 上下文学习能力的经验边界:在短自然序列上表现稳健,miRNA 任务 F1=0.902、毒素任务 F1=0.785,但随序列长度增加而退化,并在千碱基尺度崩溃。 此前上下文学习主要在通用大语言模型中被广泛研究,而基因组语言模型中该能力的边界与机制“仍缺乏刻画”;该工作以五个二分类任务(涵盖生物与人工序列)系统映射了 Evo 2 的工作区间。 证据来自五个二分类任务上的 F1 指标报告,覆盖生物与人工序列;文本以摘要形式给出,未提供样本量、数据划分或统计检验细节。
模型规模扩大并未带来收益:7B 版本系统性地优于 40B 版本。 这与通常假设的“更大模型更好”的缩放直觉相反,提示在基因组语言模型的上下文学习场景中,规模并非性能的可靠驱动因素。 证据为两个模型规模(7B 与 40B)在五个任务上的系统性比较,摘要以“systematically outperforms”表述,未给出逐任务数值或显著性检验。
困惑度这一被广泛使用的基因组语言模型性能代理指标,难以预测分类准确率。 该发现对以困惑度作为模型选择与评估依据的常见做法提出了经验性提醒,指出其与下游分类准确率之间关联薄弱。 证据来自困惑度与准确率之间的对比分析,摘要未报告相关系数或具体统计量。
机制可解释性分析为上述现象提供了一致解释:logit-lens 剖析提示存在预测—泛化权衡,Jacobian Scope 表明模型可能追踪提示的结构而非承载信号的序列内容。 该工作将行为层面的性能观察与内部机制分析相连接,为理解基因组语言模型上下文学习为何随长度退化、为何规模无益提供了机制层面的线索。 证据来自两种可解释性方法(logit-lens 与 Jacobian Scope)的剖析结果,摘要以“suggests”“might track”等表述呈现,属于提示性而非确证性结论。
启示与展望
该结果界定了 Evo 2 在短自然序列二分类任务上的可用区间,适用于以提示注入示例进行推理、且序列长度较短的场景,例如 miRNA 与毒素相关分类;对千碱基尺度的长序列任务,当前证据提示不宜依赖其上下文学习能力。对实践者而言,这意味着在基因组语言模型选型时,不应默认更大规模或更低困惑度即代表更好的下游分类表现,而应针对具体任务与序列长度做直接评测。机制层面的 logit-lens 与 Jacobian Scope 分析为后续研究提供了可检验的假设方向,即模型是否真正利用了承载信号的序列内容。
当前可见文本仅为摘要,未提供五个任务的具体数据集、样本量、序列长度分布、训练与评测划分,也未给出 7B 与 40B 对比的逐任务数值与显著性检验,因此“系统性优于”的幅度与稳健性仍待确认。困惑度与准确率关系缺乏相关系数等量化描述。logit-lens 与 Jacobian Scope 的结论以“suggests”“might track”表述,属于提示性解释,其因果地位与可复现性有待正文验证。此外,五个任务均为二分类,向多分类、回归或生成式任务的外推尚不清楚;千碱基尺度崩溃的具体阈值也未在摘要中给出。
