Dao-AILab/sonic-moe
Accelerating MoE with IO and Tile-aware Optimizations
What it solves
SonicMoE は、Mixture-of-Experts (MoE) レイヤーのパフォーマンスボトルネックを解決します。具体的には、最新の NVIDIA GPU での活性化メモリ使用量の削減とトレーニングスループットの向上に焦点を当てています。
関連
- プロジェクト
microsoft/TutelNVIDIAおよびAMD GPU上で、高度な並列化と量子化を活用して、大規模LLMのトレーニングと推論を高速化する最適化されたMixture-of-Experts (MoE) 実装です。
- Dispatch
Mixture of Experts (MoE) の解説Mixture of Experts (MoE) は、トランスフォーマーモデルがパラメータをスケールさせつつ、トークンごとにニューラルネットワークのエキスパートの一部だけを活性化することで、効率的な事前学習と高速な推論を維持できるようにします。
- プロジェクト
EfficientMoE/MoE-InfinityMoE-Infinity is a library for cost-effective MoE inference that enables running large Mixture-of-Experts models on memory-constrained GPUs by offloading expert weights to host memory and SSD.
- プロジェクト
- プロジェクト
deepseek-ai/DeepEPMoEモデル向けの高性能通信ライブラリ。エキスパート並列処理に最適化されたGPUカーネルを提供し、スループットを最大化し、SMリソースの使用を最小限に抑えます。