xtuner: 最大1Tパラメータとマルチモーダル学習をサポートする超大規模MoEモデル用トレーニングエンジン
xtuner: 最大1Tパラメータとマルチモーダル学習をサポートする超大規模MoEモデル用トレーニングエンジン
解決する課題
XTuner V1は、超大規模なMixture-of-Experts (MoE) モデルのトレーニングにおける複雑さを処理するために設計されたトレーニングエンジンです。最大1兆(1T)パラメータに達するモデルの高いメモリおよび計算需要に対処し、ハードウェア全体でこれらのモデルをスケールさせるために必要な並列化戦略を簡素化します。
仕組み
XTuner V1は、いくつかの主要な技術的アプローチを通じてトレーニングプロセスを最適化します:
- Dropless Training: エキスパート並列化の複雑さを軽減し、200B規模のMoEモデルをそれなしでトレーニングできるようにし、600Bモデルではノード内並列化のみを必要とするようにします。
- Memory Optimization: シーケンス並列化を必要とせずに、64kのシーケンス長で200B MoEモデルのトレーニングを可能にし、またシーケンス長の線形スケーリングのためにDeepSpeed Ulyssesをサポートします。
- Hardware Acceleration: このエンジンはNVIDIA GPU (FP8/BF16) と Ascend NPU (BF16) の両方に最適化されており、200Bパラメータを超えるモデルにおいて、従来の3D並列化スキームを上回る高いスループットを実現します。
対象ユーザー
このツールは、超大規模MoEモデルを扱うAI研究者やエンジニア、特に大規模な事前学習、指示微調整(instruction fine-tuning)、および強化学習(RL)に焦点を当てている人々を対象としています。
ハイライト
- Massive Scale Support: 最大1TパラメータのMoEモデルのトレーニングが可能です。
- Multimodal Capabilities: ビジョン言語モデルの事前学習および教師あり微調整をフルサポートします。
- Advanced RL Algorithms: Group Relative Policy Optimization (GRPO) を実装しており、MPOおよびDAPOの追加も拡大中です。
- Cross-Hardware Compatibility: NVIDIA H800 と Ascend A3 Supernodes の両方に最適化されています。
Sources
- undefinedInternLM/xtuner