deepseek-ai/DeepEP
DeepEP: an efficient expert-parallel communication library
解決的問題
DeepEP 解決了現代機器學習訓練與推論中的通訊瓶頸,特別是針對混合專家模型 (MoE)。它為專家並行 (EP) 的 dispatch 與 combine 操作提供高吞吐量、低延遲的 all-to-all GPU 核心,在減少 GPU 之間 Token 移動開銷的同時,最大限度地降低了串流多處理器 (SMs) 的消耗。
工作原理
DeepEP 實現了一個高性能通訊函式庫,利用輕量級的即時 (JIT) 編譯模組在執行時生成核心,從而無需在安裝期間進行 CUDA 編譯。它使用 NCCL Gin 後端進行輕量級通訊,並提供 ElasticBuffer 介面來統一高吞吐量與低延遲 API。該函式庫支援 FP8 等低精度格式,並利用 RDMA 與 NVLink 進行高效的節點間與節點內數據傳輸。它還包含用於流水線並行 (PP)、上下文並行 (CP) 與遠端記憶體存取 (Engram) 的實驗性原語。
適用對象
專為在 Hopper (SM90) GPU 或更新架構上訓練或部署大規模 MoE 模型的開發人員與研究人員設計,這些用戶需要最大化硬體頻寬並最小化通訊中的 SM 資源占用。
亮點
- 極致效率:V2 在使用 SM 資源減少高達 4 倍的情況下,實現了比 V1 高出 1.3 倍的峰值效能。
- JIT 編譯:核心在執行時編譯,簡化了安裝與部署。
- 分析式調優:自動計算最佳的 SM 與 QP 數量,無需手動自動調優。
- 廣泛的並行支援:除了專家並行,還提供對流水線並行、上下文並行與遠端記憶體存取的實驗性支援。
- 低精度支援:針對 FP8 dispatching 與 BF16 combining 進行了優化。
相關
- 專案
- 專案
- 專案
- 專案
- 專案