microsoft/Tutel

Tutel MoE: Optimized Mixture-of-Experts Library, Support GptOss/DeepSeek/Kimi-K2/Qwen3 using FP8/NVFP4/MXFP4

解決的問題

Tutel 是一種針對大規模模型訓練與推論進行優化之 Mixture-of-Experts (MoE) 實作。它解決了在高端 GPU(NVIDIA A100/H100/B200 與 AMD MI300/MI325/MI355)上部署 DeepSeek、Kimi 與 GLM 等大模型時,與 MoE 架構相關的計算瓶頸與記憶體限制問題。

工作原理

Tutel 提供高度優化的 MoE 層,以及一種稱為「無懲罰並行/稀疏性/容量切換」的並行解決方案,可在不造成效能損失的情況下動態調整並行度、稀疏性與容量。它支援 NVFP4、MXFP4 與 BlockwiseFP8 等高階量化格式,以減少記憶體佔用並提升吞吐量。專案亦包含針對 Qwen3 與 DeepSeek 的專用門控 API,並利用 NCCL all-to-all 等高效通訊原語,實現跨多個 GPU 與節點的分散式處理。

適用對象

適用於需要在 NVIDIA 與 AMD 硬體上最大化吞吐量並最小化延遲的大規模 MoE 基礎 LLM 的 AI 研究人員與工程師,以及從零開始實作自訂 MoE 層的開發者。

主要亮點

  • 廣泛硬體支援:針對 NVIDIA A100/H100/B200 與 AMD MI300/MI325/MI355 GPU 進行優化。
  • 高效率推論:支援 DeepSeek-V3.2、Kimi-K3 與 GLM-5.x 等大模型,實現高每秒令牌數(TPS)。
  • 動態設定:執行時可免費切換並行模式(DP、EP、MP)、top-k 稀疏性及容量。
  • 高階量化:直接支援 NVFP4 與 MXFP4 推論,使兆級參數模型可適配可用 VRAM。
  • 長上下文支援:可處理 GLM-5.x 與 Kimi-K3 等特定模型高達 100 萬 token 的上下文。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案