NVIDIA 在这篇技术文章中说明 NVLink 6 如何以物理层、链路层、应用层与系统层组成的多层容错框架支撑大规模 AI 工厂:物理层用轻量 FEC 配合物理层重传(PLR)与 UPHY 恢复实现原生无损,链路层用基于信用的流控(CBFC)从设计上消除丢包,应用层用 Dynamo 影子引擎恢复与检查点机制缩短中断,并称在 B200 GPU 上的基准部署中把推理停机时间从 283 秒降至 7.3 秒。
NVIDIA 在这篇技术文章中说明 NVLink 6 如何以物理层、链路层、应用层与系统层组成的多层容错框架支撑大规模 AI 工厂:物理层用轻量 FEC 配合物理层重传(PLR)与 UPHY 恢复实现原生无损,链路层用基于信用的流控(CBFC)从设计上消除丢包,应用层用 Dynamo 影子引擎恢复与检查点机制缩短中断,并称在 B200 GPU 上的基准部署中把推理停机时间从 283 秒降至 7.3 秒。