nanorepertoire:面向纳米抗体库分析的端到端 Nextflow 流程
核心概要
该工作提出 nanorepertoire——一个专用于骆驼科 VHH 纳米抗体库的端到端 Nextflow DSL2 流程,将双端 AIRR-seq FASTQ 数据经质控、接头修剪、读段合并、计算机翻译、CD-HIT 克隆分型与 nanoCDR-X 深度学习 CDR3 注释,输出包含克隆结构、CDR3 长度与氨基酸组成、克隆内均一性、库多样性及运行碳足迹的交互式 HTML 报告,并在两个公开的 SARS-CoV-2 RBD 筛选羊驼文库(共 480 万双端读段)上于 16 vCPU 云实例 59 分钟内完成,回收 41,363 个不同 CDR3 抗原结合位点,重现了筛选后克隆多样性收缩的预期现象。
深度剖析
提出一个专用于骆驼科 VHH 纳米抗体库的端到端 Nextflow DSL2 流程,把原本由零散脚本拼凑的分析整合为标准化、可复现的单一流程。 原文指出 VHH 数据分析“typically assembled ad hoc from standalone scripts, which limits standardisation and reproducibility across laboratories”,该流程针对这一现状提供统一实现。 以流程设计与开源发布(MIT 许可、Zenodo 归档、本地/HPC/云一致运行)为证据,属于工具与工程层面的贡献。
流程串联质控、接头修剪、读段合并、计算机翻译、CD-HIT 克隆分型与 nanoCDR-X 深度学习 CDR3 注释,并输出交互式 HTML 报告。 报告涵盖克隆结构、CDR3 长度与氨基酸组成、克隆内均一性、库多样性,并额外给出运行的“computational carbon footprint”,将分析结果与计算环境代价一并呈现。 以流程各步骤的明确列举与报告内容描述为证据;nanoCDR-X 引自 Bagordo et al., 2026。
在两个公开的 SARS-CoV-2 RBD 筛选羊驼文库(噬菌体展示富集前后,共 480 万双端读段)上完成运行,59 分钟于 16 vCPU 云实例,回收 41,363 个不同 CDR3 抗原结合位点,并重现筛选后克隆多样性收缩。 以真实公开数据展示流程的端到端可用性,并复现了选择压力下多样性下降这一预期生物学现象。 证据来自两个公开文库的实测运行,含读段总量、运行时长、实例规格与 CDR3 数量等具体指标;属于演示性应用证据。
启示与展望
该流程面向骆驼科 VHH 纳米抗体库的 AIRR-seq 数据分析,适用于本地、HPC 与云环境;其演示场景为两个公开的 SARS-CoV-2 RBD 筛选羊驼文库(噬菌体展示富集前后)。对于其他物种、其他抗体形式或其他测序设计,原文未给出验证,需在相应设定下另行评估。
原文为摘要层面的文本,未提供图表、参数细节与统计检验信息,因此各步骤的具体阈值、报告指标的计算方式以及碳足迹的核算口径仍需查阅全文与代码仓库;此外,流程在更多文库、不同测序深度与其他物种上的表现,以及 nanoCDR-X 注释在不同数据上的稳定性,都是值得后续观察的开放问题。
