deepspeedai/DeepSpeed

DeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.

What it solves

DeepSpeed は、GPU ハードウェアのメモリと計算リミットを克服し、極めて大規模なディープラーニングモデルの学習を可能にするために設計されています。数千億、あるいは数兆パラメータに及ぶモデルの学習を実現し、大規模 AI トレーニングをより効率的・効果的・アクセスしやすくします。

How it works

DeepSpeed は、メモリ使用量とスループットを最適化するために、さまざまなシステムレベルのイノベーションを採用しています。主な技術は次のとおりです:

  • ZeRO (Zero Redundancy Optimizer):オプティマイザ状態、勾配、パラメータをパーティション化し、GPU 間のメモリ冗長性を削減します。
  • 3D-Parallelism:異なる種類の並列化を組み合わせ、多数のデバイスにまたがって学習をスケールさせます。
  • Offloading:ZeRO‑Infinity、ZenFlow、SuperOffload などの技術で、GPU メモリと CPU/NVMe ストレージ間でデータを転送し、「メモリ壁」を打破します。
  • Sequence Parallelism:長コンテキスト LLM の学習向けに設計されています(例:Ulysses Sequence Parallelism)。

Who it’s for

大規模言語モデルやその他の大規模ディープラーニングモデルを学習し、複数 GPU や異なるハードウェアアクセラレータ(NVIDIA、AMD、Intel、Huawei)に跨ってスケールさせる必要がある AI 研究者・エンジニア向けです。

Highlights

  • Proven Scale:MT-530B や BLOOM など、世界トップクラスのモデルの学習に使用されています。
  • Hugging Face Integration:Transformers と Accelerate ライブラリと深く統合されています。
  • Broad Hardware Support:NVIDIA、AMD、Intel Gaudi/XPU、Huawei Ascend NPU に対応しています。
  • Advanced Memory Management:ZeRO や ZeRO‑Infinity などの機能により、GPU メモリ上限を超えるモデルでも学習可能です。