NCCL在GH200/GB200架构中的GPUDirect优化实践

2025-06-19 01:39:57作者：裘旻烁

Optimized primitives for collective multi-GPU communication

项目地址：https://gitcode.com/gh_mirrors/nc/nccl

背景介绍

NVIDIA的NCCL（NVIDIA Collective Communications Library）是一个针对多GPU通信优化的库，广泛应用于深度学习训练等高性能计算场景。在最新的GH200和GB200架构中，由于采用了创新的C2C NVLink连接方式，关于GPUDirect技术的适用性引发了技术讨论。

GH200/GB200架构特点

GH200和GB200采用了创新的芯片到芯片（C2C）NVLink连接技术，这与传统的PCIe连接方式有显著不同。这种架构设计带来了更高的带宽和更低的延迟，但也对通信优化提出了新的挑战。

GPUDirect技术的作用

GPUDirect技术原本设计用于绕过CPU，实现网络接口卡（NIC）与GPU之间的直接数据传输。在传统架构中，这可以显著减少数据传输延迟并提高带宽利用率。但在GH200/GB200架构中，由于C2C NVLink的存在，其价值需要重新评估。

性能测试发现

通过实际测试对比发现，在GH200平台上启用GPUDirect（通过设置NCCL_NET_GDR_LEVEL=SYS）仍能带来显著的性能提升：

All_Reduce操作性能提升约20%
AlltoAll操作性能提升约13.2%
All_Gather操作性能提升约14.9%

特别值得注意的是，启用GPUDirect后，测试结果显示接近800Gbps的理论网络带宽上限，这一表现甚至超过了PCIe 5.0 x16的理论带宽。

技术实现细节

当前NCCL版本中，GH200/GB200默认禁用GDRDMA（GPUDirect RDMA），因为初步测试显示其与传统CPU访问方式的带宽相同。然而，最新测试表明，特别是在All-to-All通信模式下，启用GDRDMA确实能带来性能优势。

最佳实践建议

对于使用GH200/GB200架构的用户，建议：

在NCCL配置中明确设置NCCL_NET_GDR_LEVEL=SYS以启用GPUDirect
关注NCCL的版本更新，后续版本可能会默认优化GH200/GB200的GPUDirect支持
针对特定应用场景进行性能测试，选择最优配置

未来展望

随着NCCL的持续优化，预计未来版本将更好地利用GH200/GB200架构的特性，进一步发挥C2C NVLink和GPUDirect的组合优势。开发者应保持对新技术发展的关注，及时调整优化策略。

通过本文的分析可以看出，即使在创新的C2C NVLink架构下，GPUDirect技术仍然有其应用价值，能够为高性能计算应用带来显著的性能提升。

Optimized primitives for collective multi-GPU communication

项目地址：https://gitcode.com/gh_mirrors/nc/nccl

登录后查看全文

最新内容推荐

LabVIEW串口通信开发全攻略：从入门到精通的完整解决方案操作系统概念第六版PDF资源全面指南：适用场景与使用教程谷歌浏览器跨域插件Allow-Control-Allow-Origin：前端开发调试必备神器 Adobe Acrobat XI Pro PDF拼版插件：提升排版效率的专业利器基恩士LJ-X8000A开发版SDK样本程序全面指南 - 工业激光轮廓仪开发利器 Windows Server 2016 .NET Framework 3.5 SXS文件下载与安装完整指南 SteamVR 1.2.3 Unity插件：兼容Unity 2019及更低版本的VR开发终极解决方案 MQTT客户端软件源代码：物联网开发的强大工具与最佳实践指南 STM32到GD32项目移植完全指南：从兼容性到实战技巧中兴e读zedx.zed文档阅读器V4.11轻量版：专业通信设备文档阅读解决方案

项目优选

收起

deepin linux kernel

OpenHarmony documentation | OpenHarmony开发者文档

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

flutter_flutter

喝着茶写代码！最易用的自托管一站式代码托管平台，包含Git托管，代码审查，团队协作，软件包和CI/CD。

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统

无需学习 Kubernetes 的容器平台，在 Kubernetes 上构建、部署、组装和管理应用，无需 K8s 专业知识，全流程图形化管理

基于golang开发的网关。具有各种插件，可以自行扩展，即插即用。此外，它可以快速帮助企业管理API服务，提高API服务的稳定性和安全性。