deepseek-ai/DeepGEMM

DeepGEMM: clean and efficient BLAS kernel library on GPU

解決的問題

DeepGEMM 是一個高性能 Tensor Core 核心庫,旨在優化現代大語言模型 (LLM) 的核心計算原語。它提供高度優化的通用矩陣乘法 (GEMM) 核心,能夠媲美甚至超越專家調優的函式庫,特別針對 NVIDIA SM90 和 SM100 架構進行了優化。

工作原理

該庫使用輕量級的即時編譯 (JIT) 模組在執行時編譯核心,無需在安裝期間進行 CUDA 編譯。它實現了多個專用核心:

  • Dense GEMMs:支援包括 FP8、FP4 和 BF16 在內的多種精度格式。
  • Grouped GEMMs:針對混合專家 (MoE) 模型進行了優化,這些模型的專家共享形狀,但處理不同的 Token 數量(連續與遮罩佈局)。
  • Mega MoE:一種融合的「mega-kernel」,將 NVLink 通訊 (EP dispatch/combine) 與 Tensor Core 計算 (Linear 1, SwiGLU, Linear 2) 進行重疊。
  • MQA Kernels:為 DeepSeek v3.2 中的 lightning indexer 提供的專用評分核心。

適用對象

面向從事 LLM 推論與訓練的開發人員與研究人員,特別是那些使用 NVIDIA H100/H800 (SM90) 或更新版本 (SM100) GPU 的用戶,以及正在尋找簡潔、易用的 GPU 核心優化學習資源的用戶。

亮點

  • 極致性能:在 H800 GPU 上實現高達 1550 TFLOPS 的性能。
  • JIT 編譯:核心在執行時編譯,簡化了安裝與部署。
  • 先進的 MoE 支援:包含將通訊與計算重疊的融合 Mega MoE 核心。
  • 廣泛的精度支援:針對 FP8 與 FP4 精度進行了優化,以實現吞吐量最大化。
  • 基於 C++20:使用現代 CUDA 程式碼庫構建,避免了對複雜模板的沉重依賴。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案