deepspeedai/DeepSpeed

DeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.

What it solves

DeepSpeed 旨在克服 GPU 硬件在训练极大深度学习模型时的内存和计算限制。它能够训练参数量达数千亿甚至兆级的模型,使大规模 AI 训练更高效、更有效且更易获取。

How it works

DeepSpeed 采用多种系统层面的创新来优化内存使用和吞吐量。关键技术包括:

  • ZeRO (Zero Redundancy Optimizer):通过对 optimizer 状态、梯度和参数进行切分,降低 GPU 之间的内存冗余。
  • 3D-Parallelism:结合不同类型的并行方式,使训练能够在大量设备上扩展。
  • Offloading:如 ZeRO‑Infinity、ZenFlow、SuperOffload 等技术,将数据在 GPU 内存与 CPU/NVMe 存储之间迁移,以突破“内存墙”。
  • Sequence Parallelism:专为长上下文 LLM 训练设计(例如 Ulysses Sequence Parallelism)。

Who it’s for

它面向需要在多 GPU 或不同硬件加速器(NVIDIA、AMD、Intel、华为)上扩展训练的大规模语言模型或其他大型深度学习模型的 AI 研究员和工程师。

Highlights

  • Proven Scale:已用于训练如 MT-530B、BLOOM 等世界领先模型。
  • Hugging Face Integration:与 Transformers 与 Accelerate 库深度集成。
  • Broad Hardware Support:兼容 NVIDIA、AMD、Intel Gaudi/XPU 与华为 Ascend NPU。
  • Advanced Memory Management:ZeRO 与 ZeRO‑Infinity 等特性,使得本来会超出 GPU 内存限制的模型得以训练。