baidu-baige/LoongForge

A high-performance framework for training LLMs, VLMs, diffusion, and embodied models on NVIDIA GPUs and Kunlun XPUs.

何を解決するか

LoongForgeは、大規模言語モデル(LLMs)、視覚言語モデル(VLMs)、拡散モデル、および身体を持つAIモデルの学習を高速化する高パフォーマンスな学習フレームワークです。並列化戦略、メモリ使用量、カーネル効率の最適化により、基準実装と同等の学習損失曲線を維持しながら、学習コストと時間を削減することを目指しています。

動作方法

LoongForgeはマルチバックエンドアーキテクチャを採用し、異なるモデルタイプに最適な学習戦略を適用します。

  • Megatron Stack: LLMs、VLMs、拡散モデル向けにカスタマイズされたMegatron-LMのパッチ版。Mixture-of-Experts(MoE)並列化、Context Parallel(CP)による長文シーケンス学習、および適応的FP8学習の最適化を含みます。
  • Torch-Native Stack: ロボティクス指向のモデルに最適化された、VLAおよびWAM向けの専用サブシステム。DDP、ZeRO-1、FSDP、HSDP戦略を用い、Megatronコアから分離することで、スループットを最大化します。

対象ユーザー

複数のモダリティにわたる大規模基盤モデルを学習する研究者およびエンジニアを対象としています。特にNVIDIA GPUまたはKunlun XPUsを使用している方、数千のアクセラレータに学習をスケーリングする必要がある方におすすめです。

主な特徴

  • MoE最適化: ワークロードのバランスと通信オーバーヘッドの低減を実現する、トポロジー認識型の動的エキスパートレプリカ配置(TAOT)を搭載。
  • 柔軟な構成: カスタムコードを書かずに、設定ファイルでViTとLLMコンポーネントを交換可能にすることでVLMを構成可能。
  • 異種並列化: ViTとLLMなど、異なるモデルコンポーネントに対して独立した並列化設定(TP/DP/再計算)をサポート。
  • 身体を持つAIのサポート: VLAおよび世界行動モデル(例:Pi0.5、GR00T)向けの特別な学習・評価モジュールを提供。
  • ハードウェア互換性: NVIDIA GPUおよびKunlun XPUsの両方をネイティブでサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch