ROCm/rccl

[DEPRECATED] Moved to ROCm/rocm-systems repo

해결하는 문제

RCCL (ROCm Communication Collectives Library)는 GPU용 표준화된 통신 루틴 세트를 제공합니다. 단일 노드 내 또는 클러스터의 여러 노드에 분산된 여러 GPU 간에 데이터를 효율적으로 이동하고 동기화하는 문제를 해결합니다.

작동 방식

RCCL은 all-reduce, all-gather, reduce, broadcast, reduce-scatter, gather, scatter, all-to-all과 같은 표준 집단 통신 패턴을 구현하며, GPU 간 직접적인 전송 및 수신 작업도 지원합니다. 최대 대역폭과 최소 지연 시간을 달성하기 위해 최적화된 루프 및 트리 알고리즘을 사용합니다. 이 라이브러리는 PCIe, xGMI, InfiniBand Verbs, TCP/IP 소켓과 같은 다양한 하드웨어 인터페이스에서 높은 대역폭을 최적화하도록 설계되었습니다.

대상 사용자

AMD GPU에서 ROCm 소프트웨어 스택을 사용하는 고성능 컴퓨팅(HPC) 및 AI 애플리케이션을 개발하는 개발자들을 위한 것입니다. 일반적으로 다중 GPU 스케일링과 동기화가 필요한 애플리케이션에 적합합니다.

주요 특징

  • 포괄적인 집단 작업: all-reduce, all-gather 등 다양한 표준 통신 루틴을 지원합니다.
  • 고대역폭 최적화: PCIe, xGMI, InfiniBand, TCP/IP에 최적화되어 있습니다.
  • 유연한 배포: 단일 또는 다중 노드에 임의의 수의 GPU를 지원합니다.
  • 다중 프로세스 지원: 단일 프로세스 또는 다중 프로세스(MPI 등) 애플리케이션과 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트