deepseek-ai/DeepGEMM

DeepGEMM: clean and efficient BLAS kernel library on GPU

解決する課題

DeepGEMMは、現代の大規模言語モデル(LLM)のコア計算プリミティブを最適化するために設計された高性能Tensor Coreカーネルライブラリです。NVIDIA SM90およびSM100アーキテクチャを特に対象とし、専門家によってチューニングされたライブラリに匹敵またはそれを上回る、高度に最適化された行列乗算(GEMM)カーネルを提供します。

仕組み

このライブラリは、軽量なJust-In-Time(JIT)モジュールを使用して実行時にカーネルをコンパイルするため、インストール時のCUDAコンパイルの必要がありません。以下の特化型カーネルを実装しています:

  • Dense GEMMs: FP8、FP4、BF16を含む様々な精度フォーマットをサポート。
  • Grouped GEMMs: エキスパートが同じ形状を共有しながら異なるトークン数を処理するMixture-of-Experts(MoE)モデル向けに最適化(連続およびマスクレイアウト)。
  • Mega MoE: NVLink通信(EP dispatch/combine)とTensor Core計算(Linear 1, SwiGLU, Linear 2)をオーバーラップさせる融合「メガカーネル」。
  • MQA Kernels: DeepSeek v3.2のlightning indexer向けの特化型スコアリングカーネル。

対象ユーザー

LLMの推論およびトレーニングに取り組む開発者や研究者、特にNVIDIA H100/H800 (SM90) またはそれ以降 (SM100) のGPUを利用する方、およびGPUカーネルの最適化を学ぶためのクリーンでアクセスしやすいリソースを探している方に適しています。

ハイライト

  • 極限のパフォーマンス: H800 GPU上で最大1550 TFLOPSを達成。
  • JITコンパイル: カーネルは実行時にコンパイルされるため、インストールとデプロイが簡素化されます。
  • 高度なMoEサポート: 通信と計算をオーバーラップさせる融合Mega MoEカーネルを含む。
  • 幅広い精度サポート: スループットを最大化するためにFP8およびFP4精度に最適化。
  • C++20ベース: 複雑なテンプレートへの過度な依存を避けた、モダンなCUDAコードベースで構築。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト