RNASeek 以 16 亿参数跨门转录组模型实现 RNA 功能预测与 GRPO 引导设计,生成核酶达野生型活性、3′ UTR 超越训练数据
核心概要
作者提出 RNASeek——一个基于 DeepSeek 架构、在跨门转录组语料上训练的 16 亿参数生成式基础模型,用自然语言 token 实现条件预测与序列设计;该模型在零样本下捕捉物种特异性转录特征与内含子-外显子边界,经微调可预测核酶自切割活性与病毒 mRNA 稳定性并揭示环柔性、茎稳定性及 AU 富集基序等可解释特征,再以这些功能预测器作为奖励模型、用 GRPO 更新生成策略,产出满足用户指定 IUPAC 约束的更快切割核酶与增强稳定性的 3′ UTR,其中实验验证的生成核酶达到野生型活性水平,生成的 3′ UTR 超过训练数据与已基准测试的 AI 生成 3′ UTR 的表现。
深度剖析
RNASeek 是一个 16 亿参数、基于 DeepSeek 架构、在跨门转录组语料上训练的生成式基础模型,统一支持 RNA 序列表示与生成,并用自然语言 token 实现灵活的条件预测与序列设计。 此前虽有大语言模型改变自然语言处理与蛋白质设计,但把 RNA 基础模型与功能序列设计连接起来的通用框架仍然有限;该工作把表示、预测与生成放在同一骨干上。 摘要报告了模型规模(16 亿参数)、架构来源(DeepSeek)与训练语料(跨门转录组),并说明自然语言 token 使统一骨干支持条件预测与设计;具体训练细节与数据规模未在摘要中给出。
RNASeek 在零样本设置下捕捉物种特异性转录特征与内含子-外显子边界;经微调后可预测核酶自切割活性与病毒 mRNA 稳定性,并揭示与功能相关的可解释序列特征,包括核酶环柔性与茎稳定性,以及与 mRNA 稳定性相关的 AU 富集基序。 把零样本转录特征识别与下游功能预测、特征解释串联起来,使模型学到的 RNA 功能具有可读的序列层面依据。 摘要以零样本设置描述物种特征与内含子-外显子边界捕捉,并以微调方式给出两类功能预测任务及相应可解释特征;摘要未提供预测性能的具体数值。
作者把功能预测器用作奖励模型,采用 Group Relative Policy Optimization(GRPO)更新 RNASeek 的生成策略,朝向具备目标性质的序列,产出切割更快的核酶与增强稳定性的 3′ UTR,同时满足用户指定的 IUPAC 约束。 将强化学习式策略优化引入 RNA 生成,使生成过程可被功能预测器引导并受用户约束控制,形成 pretrain–predict–optimize 的统一流程。 摘要明确说明以功能预测器为奖励模型、使用 GRPO 更新生成策略,并报告生成结果在切割速度、稳定性与 IUPAC 约束满足方面的表现;奖励设计与训练细节未在摘要中展开。
实验验证显示,RNASeek 生成的核酶达到野生型活性水平,生成的 3′ UTR 序列超过训练数据以及已基准测试的 AI 生成 3′ UTR 的表现。 把生成序列从计算评估推进到实验验证,并给出相对训练数据与既有 AI 生成基线的比较结果。 摘要报告了实验验证的核酶活性达到野生型水平,以及 3′ UTR 在性能上超过训练数据与已基准测试的 AI 生成 3′ UTR;摘要未给出实验规模、定量指标或统计细节。
启示与展望
该工作面向需要在序列层面设计与优化调控 RNA 的研究者与工程团队,适用场景包括核酶活性改造与 mRNA 稳定性相关的 3′ UTR 设计,并可在用户指定 IUPAC 约束下生成候选序列。其框架把预训练、功能预测与策略优化串成一条流程,使功能预测器可直接充当生成过程的奖励信号,从而把“学到 RNA 功能”转化为“可控的从头序列设计”。摘要将这一路线表述为工程化具有目标性质调控 RNA 的通用策略,因此其定位是提供可迁移的方法范式,而非仅针对单一 RNA 类型的结果。
当前仅读到摘要,正文、图表与补充材料未纳入本次总结,因此若干关键问题仍待查看原文确认:跨门转录组语料的具体构成与规模、零样本评估的判定方式、两类功能预测任务的性能指标、GRPO 奖励模型的设计与训练细节,以及实验验证的样本量与定量比较标准。摘要提到生成 3′ UTR 超过训练数据与已基准测试的 AI 生成 3′ UTR,但未给出具体数值与统计支持,读者若要评估效应大小需回到原文。此外,摘要未说明该框架在核酶与 3′ UTR 之外的其他调控 RNA 类型上的表现,这属于可进一步观察的范围。
