microsoft/Tutel

Tutel MoE: Optimized Mixture-of-Experts Library, Support GptOss/DeepSeek/Kimi-K2/Qwen3 using FP8/NVFP4/MXFP4

解决的问题

Tutel 是一种针对大规模模型训练和推理进行优化的 Mixture-of-Experts (MoE) 实现。它解决了在高端 GPU(NVIDIA A100/H100/B200 和 AMD MI300/MI325/MI355)上部署 DeepSeek、Kimi 和 GLM 等大模型时,与 MoE 架构相关的计算瓶颈和内存限制问题。

工作原理

Tutel 提供高度优化的 MoE 层以及一种名为「无惩罚并行/稀疏性/容量切换」的并行解决方案,可在不造成性能损失的情况下动态调整并行度、稀疏性和容量。它支持 NVFP4、MXFP4 和 BlockwiseFP8 等高级量化格式,以减少内存占用并提升吞吐量。项目还包含针对 Qwen3 和 DeepSeek 的专用门控 API,并利用 NCCL all-to-all 等高效通信原语,实现跨多个 GPU 和节点的分布式处理。

适用人群

适用于需要在 NVIDIA 和 AMD 硬件上最大化吞吐量并最小化延迟的大规模 MoE 基础 LLM 的 AI 研究人员和工程师,以及从零开始实现自定义 MoE 层的开发者。

主要亮点

  • 广泛硬件支持:针对 NVIDIA A100/H100/B200 和 AMD MI300/MI325/MI355 GPU 进行优化。
  • 高性能推理:支持 DeepSeek-V3.2、Kimi-K3 和 GLM-5.x 等大模型,实现高每秒令牌数(TPS)。
  • 动态配置:运行时可免费切换并行模式(DP、EP、MP)、top-k 稀疏性及容量。
  • 高级量化:直接支持 NVFP4 和 MXFP4 推理,使万亿参数模型可适配可用 VRAM。
  • 长上下文支持:可处理 GLM-5.x 和 Kimi-K3 等特定模型高达 100 万 token 的上下文。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目