deepseek-ai/DeepGEMM
DeepGEMM: clean and efficient BLAS kernel library on GPU
解決する課題
DeepGEMMは、現代の大規模言語モデル(LLM)のコア計算プリミティブを最適化するために設計された高性能Tensor Coreカーネルライブラリです。NVIDIA SM90およびSM100アーキテクチャを特に対象とし、専門家によってチューニングされたライブラリに匹敵またはそれを上回る、高度に最適化された行列乗算(GEMM)カーネルを提供します。
仕組み
このライブラリは、軽量なJust-In-Time(JIT)モジュールを使用して実行時にカーネルをコンパイルするため、インストール時のCUDAコンパイルの必要がありません。以下の特化型カーネルを実装しています:
- Dense GEMMs: FP8、FP4、BF16を含む様々な精度フォーマットをサポート。
- Grouped GEMMs: エキスパートが同じ形状を共有しながら異なるトークン数を処理するMixture-of-Experts(MoE)モデル向けに最適化(連続およびマスクレイアウト)。
- Mega MoE: NVLink通信(EP dispatch/combine)とTensor Core計算(Linear 1, SwiGLU, Linear 2)をオーバーラップさせる融合「メガカーネル」。
- MQA Kernels: DeepSeek v3.2のlightning indexer向けの特化型スコアリングカーネル。
対象ユーザー
LLMの推論およびトレーニングに取り組む開発者や研究者、特にNVIDIA H100/H800 (SM90) またはそれ以降 (SM100) のGPUを利用する方、およびGPUカーネルの最適化を学ぶためのクリーンでアクセスしやすいリソースを探している方に適しています。
ハイライト
- 極限のパフォーマンス: H800 GPU上で最大1550 TFLOPSを達成。
- JITコンパイル: カーネルは実行時にコンパイルされるため、インストールとデプロイが簡素化されます。
- 高度なMoEサポート: 通信と計算をオーバーラップさせる融合Mega MoEカーネルを含む。
- 幅広い精度サポート: スループットを最大化するためにFP8およびFP4精度に最適化。
- C++20ベース: 複雑なテンプレートへの過度な依存を避けた、モダンなCUDAコードベースで構築。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト