baidu-baige/LoongForge

A unified, high-performance framework for training LLMs, VLMs, diffusion, and embodied models on NVIDIA GPUs and Kunlun XPUs.

解決する課題

LoongForgeは、大規模言語モデル(LLM)、視覚言語モデル(VLM)、拡散モデル、およびエンボディドAIモデル(VLA/WAM)のトレーニングを統合するために設計された高性能トレーニングフレームワークです。さまざまなハードウェアにわたって異なるモデルタイプをトレーニングする際の非効率性と断片化に対処し、事前学習、継続的な事前学習、および教師あり微調整(SFT)をサポートする単一のスタックを提供します。

仕組み

LoongForgeは、モデルのタイプに応じて複数の分散バックエンドを利用します。LLM、VLM、および拡散モデルはパッチ適用されたMegatron-LM上で実行され、エンボディドモデルはtorchネイティブのDDP/FSDPスタックを使用します。このフレームワークは、NVIDIA GPUとKunlun XPUの両方をサポートしています。スループットを向上させるために、いくつかの最適化技術を採用しています:

  • ヘテロジニアス・パラレリズム(異種並列性): 異なるモデルコンポーネント(例:ViTとLLMの分離)に対して、独立したテンソル並列(TP)、データ並列(DP)、および再計算を可能にします。
  • MoE最適化: 重畳されたAll2All、アクティベーション・オフロード、およびトポロジー認識型のエキスパート・ロードバランシング・アルゴリズムを含みます。
  • 適応型FP8トレーニング: ブロック単位のFP8を使用し、オペレータの効率に基づいて精度を選択するオプションの適応モードを備えています。
  • DPロードバランシング: シーケンスパッキングの不均衡を軽減するためにデータを再分配します。
  • カスタム融合オペレータ: 特定のモデルアーキテクチャを加速するために、FusedDSAなどの高性能カーネルを実装しています。

対象者

LoongForgeは、大規模モデルのトレーニングに取り組む研究者やエンジニア、特に異種ハードウェア(NVIDIAおよびKunlun XPU)にわたってマルチモーダルまたはエンボディドAIモデルをトレーニングする必要がある方を対象としています。

ハイライト

  • 統合フレームワーク: LLM、VLM、Diffusion、およびエンボディドモデルを1か所でサポート。
  • 幅広いモデルサポート: DeepSeek、Qwen、LLaMA、GR00Tを含む幅広いSOTAモデルと互換性があります。
  • ハードウェア非依存: NVIDIA GPUとKunlun XPUの両方をネイティブサポート。
  • 大幅なスピードアップ: ベースラインに対して大幅なトレーニング加速を実現(例:DeepSeek-V3.2 Liteで5.04倍)。
  • 柔軟な構成: 交換可能なコンポーネントからVLMを構成駆動で組み立て可能。
  • シームレスなチェックポインティング: MegatronとHuggingFace形式の間での双方向変換。