NeMo-DCR 只传约 1% 变化权重,把 1T 模型跨集群重配从 87.5 分钟压到 150 秒
核心概要
NeMo-DCR 提出一种比特精确的增量重配方法:在规范坐标下只传输每步变化的权重,用固定仿射映射直接投影变化、用残差转换覆盖其余变化,并以 XOR 掩码与覆写混合编码、经原生加载器原地应用,配合可恢复的联合提交;在 30B–1T 模型、3% 与 5% 变化率的压力测试中,重配比仅传输全量检查点的参考方案快 12–40 倍,1T 中继树重配耗时 150 秒而非 87.5 分钟。
深度剖析
直接投影与残差转换把训练分片中的变化直接映射到 Hugging Face 规范坐标,避免为仿射变化组装和转换完整张量;残差转换则通过分布式残差基线覆盖共享缩放因子等其余变化。 此前系统要么重新实现服务运行时的放置规则,要么先组装完整张量再提取增量;这里把仿射变化留在分片所有者本地投影,只对残差任务构造规范张量。 在 Qwen3-30B-A3B 与 Qwen3-235B-A22B 的 3% 和 5% 压力用例中,直接投影使增量构建比全量转换快 1.08–1.16 倍;仿射映射覆盖 Qwen3-30B-A3B 检查点 96.3%、Nemotron-3-Ultra-550B-A55B 97.0% 的权重字节。
混合 XOR/覆写编码在保持比特精确的同时提升压缩率:表示保持路径上的变化用 XOR 掩码承载,其余用绝对覆写承载。 算术重建可能引入浮点舍入误差,绝对覆写虽无舍入却重传变化值内的未变比特;XOR 掩码只翻转真正不同的比特,因而更易压缩。 在 2000 万个 BF16 标准正态值加高斯噪声的合成基准上,zstd 一级压缩后 XOR 流比覆写流小 1.7–2.2 倍;Qwen3 上 XOR 编码使载荷字节比纯覆写减少 38–40%。
接收端把放置交给服务运行时的原生加载器并原地应用更新,不保留接收端基线副本;重试以覆写修复部分写入,联合提交把策略版本与其源基线绑定。 原地应用避免了单独的接收端基线拷贝,但中断的重配会留下新旧混合状态;这里用覆写重试加联合提交恢复,并给出比特精确性的命题与证明。 与同一候选权重产生的稠密重配逐位比较,所有参数与缓冲区元素(含未变元素)比特相等;在每五步随机杀死一个 vLLM 实例的 50 步 GRPO 训练中,两种传输的平均奖励均为 0.41,与稠密 NCCL 一致。
对象存储或中继树在增量构建期间流式传输载荷,不使用跨集群集合通信,使传输与构建重叠。 跨集群集合通信会把接收方成员关系耦合到训练集群并在故障时引入超时;这里两种传输都支持无直连与有直连两种部署。 Nsight Systems 轨迹显示中继树传输下界占重配延迟的 77–94%,构建下界占 18–45%;120B 重配耗时 22.6–49.7 秒,比参考方案快 15.1–33.2 倍。
启示与展望
该结果面向把 rollout 与训练分离、且每次策略更新都需跨广域网同步的智能体 RL 部署,适用于训练与服务两侧并行度独立选择、双方都支持 Hugging Face 规范张量布局的场景。它同时支持对象存储与集群间直连两种拓扑,因此既覆盖仅通过共享存储交换权重的部署,也覆盖有直连链路的部署。方法依赖服务运行时原生加载器完成放置,并要求加载器路径可被预先分类与校验;对无法满足这些条件的加载器路径,系统会提前拒绝。源基线保存在主机内存中,跨训练 rank 合计约一个检查点,因此适用性也与训练侧主机内存容量相关。
读者仍需关注:3% 与 5% 的变化率是超出实测 0.6–1.2% 的压力用例,真实训练中变化率随学习率与训练阶段变化,收益会随之浮动;训练实验在 30B 模型、50 步 GRPO 上验证了接收端被杀场景,更大模型与更长训练下的故障组合仍有待观察;重配延迟中传输下界占 77–94%,因此跨集群带宽与拓扑仍是主导因素;此外,本文为快速解析版本,图表与附录细节未完整呈现,若需复现具体配置应查阅原文附录。
