microsoft/Tutel

Tutel MoE: Optimized Mixture-of-Experts Library, Support GptOss/DeepSeek/Kimi-K2/Qwen3 using FP8/NVFP4/MXFP4

해결하는 문제

Tutel은 대규모 모델의 학습과 추론을 가속화하기 위해 최적화된 Mixture-of-Experts (MoE) 구현체입니다. 특히 DeepSeek, Kimi, GLM과 같은 대규모 모델을 고성능 GPU(NVIDIA A100/H100/B200 및 AMD MI300/MI325/MI355)에 배포할 때 발생하는 계산적 병목과 메모리 제약을 해결합니다.

작동 방식

Tutel은 고도로 최적화된 MoE 레이어와 '패널티 없는 병렬화/스파스티시/용량 전환'이라는 병렬 솔루션을 제공합니다. 이는 성능 저하 없이 병렬화, 스파스성, 용량을 런타임 중에 동적으로 조정할 수 있게 해줍니다. NVFP4, MXFP4, BlockwiseFP8와 같은 고급 양자화 형식을 지원하여 메모리 사용량을 줄이고 처리량을 높입니다. 또한 Qwen3 및 DeepSeek 전용 게이팅 API를 포함하고, NCCL all-to-all과 같은 효율적인 통신 프리미티브를 활용하여 다수의 GPU 및 노드 간 분산 처리를 구현합니다.

대상 사용자

NVIDIA 및 AMD 하드웨어에서 처리량을 극대화하고 지연을 최소화해야 하는 대규모 MoE 기반 LLM을 다루는 AI 연구자 및 엔지니어, 또는 자체 MoE 레이어를 처음부터 구현하는 개발자에게 적합합니다.

주요 특징

  • 광범위한 하드웨어 지원: NVIDIA A100/H100/B200 및 AMD MI300/MI325/MI355 GPU에 최적화되어 있습니다.
  • 고성능 추론: DeepSeek-V3.2, Kimi-K3, GLM-5.x와 같은 대규모 모델을 높은 토큰/초(TPS)로 처리할 수 있습니다.
  • 동적 구성: 런타임 중에 병렬화(DP, EP, MP), top-k 스파스성, 용량을 비용 없이 전환할 수 있습니다.
  • 고급 양자화: 트릴리언 파라미터 모델을 가용 VRAM에 맞게 수용할 수 있도록 NVFP4 및 MXFP4 추론을 직접 지원합니다.
  • 장문맥 지원: GLM-5.x 및 Kimi-K3와 같은 특정 모델에서 최대 100만 토큰의 문맥을 처리할 수 있습니다.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트