NVIDIA/nccl

Optimized primitives for collective multi-GPU communication

何を解決するか

複数のGPU間での効率的なデータ交換を可能にする、最適化されたGPU通信プリミティブを提供します。これは、単一ノード上に配置されている場合でも、複数ノードに分散している場合でも対応可能です。

動作方法

NCCLは、all-reduce、all-gather、reduce、broadcast、reduce-scatterなどの標準的な通信ルーチン、および一般的な送受信パターンを実装しています。PCIe、NVLink、NVswitch、InfiniBand Verbs、TCP/IPソケットなどのさまざまなハードウェアプラットフォームで高帯域幅を実現するように最適化されています。

対象ユーザー

MPIなどのシングルまたはマルチプロセス環境を使用してマルチGPUアプリケーションを開発する開発者で、高性能なGPU間通信を必要とする方々です。

主な特徴

  • PCIe、NVLink、NVswitchでの高帯域幅に最適化されています。
  • 複数ノード間通信にInfiniBand VerbsおよびTCP/IPソケットをサポートしています。
  • シングルプロセスおよびマルチプロセスアプリケーションと互換性があります。
  • all-reduce、all-gatherなど、幅広い標準的な通信ルーチンを実装しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト