functional-standard-atlas:针对饱和基因组编辑测量的变异效应预测器衰减校正、区域分辨基准
核心概要
该工作构建了一个冻结、内容哈希的数据资产与统一评分框架,将七个MaveDB饱和基因组编辑(SGE)评分集映射到GRCh38并方向统一后冻结为不可变矩阵,对十九个变异效应预测器在十六个分层上进行逐基因Spearman ρ的DerSimonian–Laird随机效应荟萃分析,并加入逐层测量可靠性估计、衰减校正、配对相关检验与留一基因验证,覆盖64,178个变异与七个癌症易感基因。
深度剖析
建立了一个可审计、可复现的基准资产:七个MaveDB SGE评分集经GRCh38映射与方向统一后冻结为带SHA-256清单的不可变矩阵,每个预测器有独立目录、固定环境与score.py入口。 相对于以往直接使用MaveDB评分而不冻结、不哈希、不统一方向的评测方式,这里把数据资产本身作为一等交付物,使结果可被逐字节核验。 仓库结构、config/assays.yaml登记表、data/frozen/的SHA-256清单与CONVENTIONS.md中“冻结数据不可变、依赖精确固定”的规则共同支撑;测试层面报告202项收集、干净解压后178项通过、第179项校验映射参考碱基并在服务不可达时跳过。
在评测统计上引入逐层测量可靠性估计与衰减校正,并用DerSimonian–Laird随机效应荟萃分析在十六个分层上汇总逐基因Spearman ρ,同时做配对依赖相关检验与留一基因验证。 相对于只报告原始相关系数的做法,这里显式估计测量可靠性并对衰减进行校正,使预测器表现与SGE测量上限之间的关系被区分开来。 由atlas.reliability(衰减上限)、atlas.evaluate_ext(19×16网格)、atlas.robustness(并列、功效、配对检验)与atlas.simulate_attenuation(151,200次试验验证)等分析模块支撑,且所有数字从results/下的文件读取而非转录。
提供了分层级的可复现路径,明确区分“能重跑全部图表”与“能从头重算预测器分数”两种能力。 相对于只声明“代码已开源”的做法,这里用四个层级说明每一层能做什么、耗时与磁盘占用,并指出Tier 2(加Zenodo归档)即可重新生成论文中每一张图与表。 Tier 1为git clone后运行130项纯代码护栏(72项因缺数据跳过,约25秒、20 MB);Tier 2加归档后不到1分钟、60 MB;Tier 3联网重建冻结矩阵约20分钟、2.2 GB;Tier 4需API密钥与GPU从头重算约40小时、6 GB。
对数据与预测器列的许可条款做了逐列区分与披露。 相对于把整份数据笼统标为开放许可的做法,这里指出冻结矩阵(仅测定值、无预测器列)为无附加条件的CC BY 4.0,而results/下的评分矩阵及由其派生的图表含十九个混合条款的预测器列,其中八个比CC BY 4.0更严格,三个未能定位到许可条款。 逐列许可与来源URL记录在results/predictor_resources_v1.tsv中作为唯一事实来源,LICENSE-DATA复述完整摘要以免依赖该文件存在。
启示与展望
该基准面向七个癌症易感基因的SGE测量与十九个预测器,适用于需要区分预测器表现与测量可靠性上限的评测场景;其冻结矩阵与评分框架可直接用于复核论文图表(Tier 2),也可通过模板与测定登记表扩展到新的预测器或新的MaveDB测定。从头重算预测器分数需要AlphaGenome API密钥与一块NVIDIA A6000(48 GB)GPU,其中Evo2-7B对46,392个SNV耗时25小时;无密钥或无GPU的读者仍可复现全部图表与数字,只是无法从API重新导出这些分数。
读者仍需留意:本仓库文本未给出各基因、各预测器的具体相关系数数值与排名,这些需从results/下的表格读取;衰减校正依赖逐层测量可靠性估计,其估计方式与不确定性区间需在正文中核对;十九个预测器列的许可条款混合,其中三个未能定位到许可条款,复用评分矩阵及其派生图表时需逐列确认;此外,随附的剪接区域预测器排序与校准的姊妹手稿使用重叠的MaveDB测定子集,但不做可靠性估计与衰减校正,且不共享结果章节、图表,两者结论不宜直接互换。
