NVIDIA/nccl
Optimized primitives for collective multi-GPU communication
何を解決するか
複数のGPU間での効率的なデータ交換を可能にする、最適化されたGPU通信プリミティブを提供します。これは、単一ノード上に配置されている場合でも、複数ノードに分散している場合でも対応可能です。
動作方法
NCCLは、all-reduce、all-gather、reduce、broadcast、reduce-scatterなどの標準的な通信ルーチン、および一般的な送受信パターンを実装しています。PCIe、NVLink、NVswitch、InfiniBand Verbs、TCP/IPソケットなどのさまざまなハードウェアプラットフォームで高帯域幅を実現するように最適化されています。
対象ユーザー
MPIなどのシングルまたはマルチプロセス環境を使用してマルチGPUアプリケーションを開発する開発者で、高性能なGPU間通信を必要とする方々です。
主な特徴
- PCIe、NVLink、NVswitchでの高帯域幅に最適化されています。
- 複数ノード間通信にInfiniBand VerbsおよびTCP/IPソケットをサポートしています。
- シングルプロセスおよびマルチプロセスアプリケーションと互換性があります。
- all-reduce、all-gatherなど、幅広い標準的な通信ルーチンを実装しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト