ROCm/rccl

[DEPRECATED] Moved to ROCm/rocm-systems repo

解決的問題

RCCL(ROCm Communication Collectives Library)提供一組 GPU 專用的標準化通訊例程。它解決了在單一節點內或分散於叢集多個節點上的多個 GPU 之間,高效移動與同步資料的問題。

工作原理

RCCL 實作 all-reduce、all-gather、reduce、broadcast、reduce-scatter、gather、scatter 與 all-to-all 等標準集體通訊模式,以及 GPU 到 GPU 的直接傳送與接收作業。它使用經過最佳化的環狀與樹狀演算法,以最大化吞吐量並最小化延遲。此函式庫針對 PCIe、xGMI、InfiniBand Verbs 與 TCP/IP 套接字等多種硬體介面進行高頻寬優化。

適用對象

專為使用 AMD GPU 上 ROCm 軟體堆疊開發高階運算(HPC)與 AI 應用的開發者設計,這些應用通常需要多 GPU 擴展與同步。

主要特色

  • 全面的集體運算:支援 all-reduce、all-gather 等多種標準通訊例程。
  • 高頻寬優化:針對 PCIe、xGMI、InfiniBand 與 TCP/IP 進行最佳化。
  • 彈性部署:支援單一或跨多個節點的任意數量 GPU。
  • 多進程支援:相容單進程或多進程(例如 MPI)應用程式。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案