NVIDIA/nccl
Optimized primitives for collective multi-GPU communication
해결하는 문제
단일 노드 또는 여러 노드에 분산된 여러 GPU 간에 효율적인 데이터 교환을 가능하게 하는 최적화된 GPU 통신 기본 연산을 제공합니다.
작동 방식
NCCL은 all-reduce, all-gather, reduce, broadcast, reduce-scatter와 같은 표준 통신 루틴과 일반적인 send/receive 패턴을 구현합니다. PCIe, NVLink, NVswitch 및 InfiniBand Verbs, TCP/IP 소켓과 같은 다양한 하드웨어 플랫폼에서 고대역폭을 실현하도록 최적화되어 있습니다.
대상 사용자
MPI와 같은 단일 또는 다중 프로세스 환경을 사용하여 다중 GPU 애플리케이션을 개발하고, 고성능 GPU 간 통신이 필요한 개발자들입니다.
주요 특징
- PCIe, NVLink, NVswitch에서 고대역폭에 최적화되어 있습니다.
- 다중 노드 통신을 위해 InfiniBand Verbs 및 TCP/IP 소켓을 지원합니다.
- 단일 또는 다중 프로세스 애플리케이션과 호환됩니다.
- all-reduce, all-gather 등 다양한 표준 통신 루틴을 구현합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트