hpcaitech/ColossalAI
Making large AI models cheaper, faster and more accessible
What it solves
Colossal-AI は、大規模 AI モデルのトレーニングと推論を、より安価に、より高速に、そしてより手軽に行えるよう設計されています。複数 GPU や多様なハードウェア構成にまたがってディープラーニングモデルをスケールさせる際に発生する高い計算コストとメモリ制限の問題に対処します。
How it works
本プロジェクトは、単一のラップトップで開発するかのように分散ディープラーニングモデルを簡単に記述できるよう、並列コンポーネントとメモリ管理ツールのスイートを提供します。以下のような高度な並列化戦略を採用しています:
- Parallelism Strategies:データ並列、パイプライン並列、そして様々なテンソル並列(1D、2D、2.5D、3D)に加え、シーケンス並列と Zero Redundancy Optimizer(ZeRO)。
- Auto-Parallelism:ハードウェア全体へのモデル分配を自動で処理。
- Heterogeneous Memory Management:PatrickStar などのツールを用いて、異なるハードウェア層間のメモリを管理。
- Configuration-based Usage:設定ファイルで並列設定を定義でき、よりフレンドリーなユーザー体験を提供。
Who it’s for
LLM や動画生成モデル(例:Sora)、画像生成モデル(例:Stable Diffusion)などを大規模クラスターにスケールさせる、またはコンシューマー向け GPU で最適化したい AI 研究者や開発者を対象としています。
Highlights
- Broad Model Support:LLaMA 1/2/3、GPT-3、BERT、PaLM、MoE モデル向けの最適化実装を含む。
- Significant Performance Gains:B200 や H200 といったハイエンド GPU 上で、スループットが大幅に向上するベンチマーク結果があります。
- Real-World Applications:動画生成プロジェクト Open‑Sora や、完全な RLHF パイプラインを備えた ChatGPT クローンの ColossalChat を支えています。
- Memory Efficiency:Stable Diffusion のトレーニング時のメモリ消費を最大 5.6 倍削減でき、RTX 3060 などの低価格ハードウェアでもトレーニングが可能です。