deepspeedai/DeepSpeed
DeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.
What it solves
DeepSpeed 是為了解決 GPU 硬體在訓練極大型深度學習模型時的記憶體與運算限制而設計的。它能訓練參數量達數千億甚至兆級的模型,讓大規模 AI 訓練變得更有效率、更具效能且更易取得。
How it works
DeepSpeed 採用多種系統層面的創新來優化記憶體使用與吞吐量。主要技術包括:
- ZeRO (Zero Redundancy Optimizer):透過將 optimizer 狀態、梯度與參數切分,減少 GPU 之間的記憶體冗餘。
- 3D-Parallelism:結合不同類型的平行化方式,讓訓練能在大量裝置上擴展。
- Offloading:如 ZeRO‑Infinity、ZenFlow、SuperOffload 等技術,將資料在 GPU 記憶體與 CPU/NVMe 儲存之間搬移,以突破「記憶體牆」。
- Sequence Parallelism:專為長上下文 LLM 訓練設計(例如 Ulysses Sequence Parallelism)。
Who it’s for
此套件適用於訓練大規模語言模型或其他大型深度學習模型的 AI 研究者與工程師,且需要在多顆 GPU 或不同硬體加速器(NVIDIA、AMD、Intel、華為)上擴展訓練。
Highlights
- Proven Scale:已用於訓練如 MT-530B、BLOOM 等世界領先模型。
- Hugging Face Integration:與 Transformers 與 Accelerate 函式庫深度整合。
- Broad Hardware Support:相容於 NVIDIA、AMD、Intel Gaudi/XPU 與華為 Ascend NPU。
- Advanced Memory Management:ZeRO 與 ZeRO‑Infinity 等功能,使得本來會超出 GPU 記憶體上限的模型得以訓練。