ByteDance-Seed/Triton-distributed
Distributed Compiler and Optimized Parallel Kernels
何を解決するか
Triton-distributedは、計算と通信を重ねた高度に最適化された分散カーネルを開発する難しさに対処します。プログラマーが手動で最適化されたライブラリと競合可能な効率的なカーネル(例:Distributed-GEMM)を、コンパイラベースのアプローチの柔軟性を保ちつつ作成できるようにします。
仕組み
OpenAI Tritonに基づくこの分散コンパイラは、GPU間のデータ移動が計算と同時に進行するカーネルの設計を可能にする低レベルのプリミティブを提供します。Nvidia(SM80、SM89、SM90a)およびAMD(CDNA3)GPUを含む複数のハードウェアバックエンドをサポートし、NVLink、InfiniBand(IB)、PCIeなどの通信レイヤーを利用します。
対象ユーザー
大規模モデルの分散トレーニングや推論のパフォーマンス最適化が必要なGPUカーネル開発者やAI研究者向けに設計されています。特にTensor Parallelism(TP)およびExpert Parallelism(EP)を扱っている方々に適しています。
特徴
- 計算-通信の重ね合わせ:通信の遅延を隠すために、計算と通信を重ねるよう特別に設計されています。
- 広範なハードウェア対応:NvidiaおよびAMD GPUの両方に対応しています。
- 高いパフォーマンス:AllGather GEMMやGEMM ReduceScatterなどの演算において、手動最適化されたライブラリと同等またはそれ以上のパフォーマンスを達成しています。
- 推論の高速化:実証された高速化(例:Seed-OSS-36B-Instructで1.33倍)および低遅延のAllToAll実装を実現しています。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト