跳到主要内容
返回时间线
bioRxiv来源发表:

PlantRegMoD:面向植物再生研究的整合型AI驱动多组学数据库

核心概要

该工作构建了PlantRegMoD,一个面向植物再生的AI驱动整合型多组学数据库,整合了来自147个项目、32个物种、2,593个样本的20.54 TB标准化多组学数据,建立了涵盖五大类、九种再生模型的统一层级分类体系,整理了236个再生基因及其在58个代表性植物物种中的28,190个同源基因,并包含196,423个单细胞和超过881万个表观遗传峰,配备九个在线组学工具和基于RAG的智能问答系统。

AI-generated editorial illustration: PlantRegMoD: An integrative and AI-driven multi-omics database for plant regeneration research

深度剖析

建立了植物再生领域统一的层级分类体系,涵盖根尖再生、嫁接、从头根再生、愈伤组织再生、原生质体再生和体细胞胚胎发生等九种实验模型,并为每种模型提供数据摘要、关键调控基因、核心分子调控机制和简要实验方案。 此前该领域缺乏统一分类标准,阻碍了跨研究的机制比较与整合;该工作基于已有研究修订并优化了这一分类体系。 基于对147个项目的系统整理,覆盖32个物种和2,593个样本,数据经标准化流程处理以保证可比性和可靠性。

系统整理了拟南芥中236个再生相关候选基因(其中102个经实验验证为核心再生基因),并在覆盖苔藓、蕨类、裸子植物、石松、基部被子植物、单子叶和双子叶等主要演化谱系的58个代表性植物物种中鉴定了75个直系同源组、共28,190个再生相关基因。 此前唯一可用的再生数据库REGENOMICS仅覆盖转录组数据,缺乏表观遗传资源和跨物种同源基因分析;该模块提供了系统发育树、基因结构图、多序列比对和保守基序图等演化分析结果。 基因集经GO富集分析验证其高可靠性,同源基因鉴定覆盖58个物种的多个演化谱系。

整合了2,221个转录组数据集、39个高质量scRNA-seq数据集(覆盖196,423个单细胞、注释为39种细胞类型)以及355个样本的表观遗传数据(包括78个ATAC-seq、224个ChIP-seq、39个BS-seq和14个m6A-seq数据集,共881万个注释峰)。 此前没有平台将多层组学数据与智能分析工具整合,以支持湿实验研究者的数据挖掘和假设验证;该工作填补了这一空白。 单细胞模块整合了210个经实验验证的标记基因和609个通过严格统计筛选新鉴定的候选标记基因;表观遗传模块支持基于基因或基因组位点的灵活检索。

开发了九个用户友好的生物信息学工具(包括BLAST同源搜索、多序列比对、系统发育可视化、GO和KEGG富集分析、PlantTF-PK转录因子和蛋白激酶预测、JBrowse基因组浏览器、PCR引物和sgRNA设计工具)以及基于RAG的智能问答系统(由GLM-4-Flash大语言模型驱动)。 此前没有平台将多层组学数据与智能分析工具整合以降低湿实验研究者的生物信息学门槛;该问答系统利用 curated 知识库和注释文献支持自然语言交互。 工具模块集成了九个实用工具,问答系统基于GLM-4-Flash大语言模型和RAG技术构建。

启示与展望

该平台旨在服务于植物再生研究领域,特别是为湿实验研究者提供数据挖掘和假设验证支持。其分类体系覆盖九种再生模型,基因模块以拟南芥为参考模型并扩展到58个代表性植物物种。该平台计划定期更新新数据集和功能,以持续作为社区资源。

该文为预印本,尚未经过同行评审。平台的实际可用性、数据更新频率和长期维护情况有待验证。RAG问答系统在实际使用中的准确性和覆盖范围需要用户反馈来评估。分类体系在非模式植物中的适用性以及同源基因功能推断的可靠性是值得关注的方向。此外,由于当前解析未包含补充图表和表格,部分技术细节(如标准化流程的具体参数)无法在此总结中呈现。

来源