baidu-baige/LoongForge

A high-performance framework for training LLMs, VLMs, diffusion, and embodied models on NVIDIA GPUs and Kunlun XPUs.

解決的問題

LoongForge 是一個為加速大型語言模型(LLMs)、視覺-語言模型(VLMs)、擴散模型以及具身智能模型訓練而設計的高效率訓練框架。它透過優化平行策略、記憶體使用與核心效率,在維持與基線實作相同訓練損失曲線的同時,旨在降低訓練成本與時間。

工作原理

LoongForge 採用多後端架構,為不同模型類型應用最佳訓練策略:

  • Megatron Stack:專為 LLMs、VLMs 和擴散模型所修改的 Megatron-LM 版本,包含 Mixture-of-Experts(MoE)平行化優化、透過上下文平行(CP)實現長序列訓練,以及自適應 FP8 訓練優化。
  • Torch-Native Stack:專為具身模型(VLA 和 WAM)設計的子系統,使用 DDP、ZeRO-1、FSDP 和 HSDP 策略,與 Megatron 核心解耦,以最大化面向機器人模型的吞吐量。

適用對象

適用於在多種模態上訓練大型基礎模型的研究人員與工程師,特別是使用 NVIDIA GPU 或 Kunlun XPUs,並需要將訓練擴展至數千個加速器的使用者。

主要亮點

  • MoE 優化:支援拓撲感知的動態專家副本放置(TAOT),實現負載均衡並減少通訊開銷。
  • 靈活組合:透過設定檔即可組裝 VLM,無需撰寫自訂程式碼,支援 ViT 與 LLM 組件的交換。
  • 異質平行:支援不同模型元件(如 ViT 與 LLM)獨立設定平行策略(TP/DP/重計算)。
  • 具身智能支援:為 VLA 和世界動作模型(如 Pi0.5、GR00T)提供專用的訓練與評估模組。
  • 硬體相容性:原生支援 NVIDIA GPU 與 Kunlun XPUs。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch