baidu-baige/LoongForge

A unified, high-performance framework for training LLMs, VLMs, diffusion, and embodied models on NVIDIA GPUs and Kunlun XPUs.

해결하는 문제

LoongForge는 대규모 언어 모델(LLM), 시각-언어 모델(VLM), 확산 모델 및 Embodied AI 모델(VLA/WAM)의 학습을 통합하기 위해 설계된 고성능 학습 프레임워크입니다. 다양한 하드웨어에서 서로 다른 모델 유형을 학습할 때 발생하는 비효율성과 파편화 문제를 해결하며, 사전 학습(Pre-training), 지속적 사전 학습(Continued Pre-training) 및 지도 미세 조정(SFT)을 지원하는 단일 스택을 제공합니다.

작동 원리

LoongForge는 모델 유형에 따라 여러 분산 백엔드를 활용합니다. LLM, VLM 및 확산 모델은 패치된 버전의 Megatron-LM에서 실행되며, Embodied 모델은 torch-native DDP/FSDP 스택을 사용합니다. 이 프레임워크는 NVIDIA GPU와 Kunlun XPU를 모두 지원합니다. 처리량을 높이기 위해 다음과 같은 최적화 기술을 사용합니다:

  • Heterogeneous Parallelism (이종 병렬성): 서로 다른 모델 구성 요소(예: ViT와 LLM 분리)에 대해 독립적인 텐서 병렬성(TP), 데이터 병렬성(DP) 및 재계산을 허용합니다.
  • MoE 최적화: Overlapped All2All, activation offload 및 topology-aware expert load balancing 알고리즘을 포함합니다.
  • Adaptive FP8 학습: 블록 단위 FP8을 사용하며, 연산자 효율성에 따라 정밀도를 선택하는 선택적 적응 모드를 제공합니다.
  • DP Load Balancing: 시퀀스 패킹 불균형을 완화하기 위해 데이터를 재분배합니다.
  • Custom Fused Operators: 특정 모델 아키텍처를 가속화하기 위해 FusedDSA와 같은 고성능 커널을 구현합니다.

대상 사용자

LoongForge는 대규모 모델 학습을 수행하는 연구자 및 엔지니어, 특히 이종 하드웨어(NVIDIA 및 Kunlun XPU)에서 멀티모달 또는 Embodied AI 모델을 학습해야 하는 분들을 위해 설계되었습니다.

주요 특징

  • 통합 프레임워크: LLM, VLM, Diffusion 및 Embodied 모델을 한 곳에서 지원합니다.
  • 폭넓은 모델 지원: DeepSeek, Qwen, LLaMA, GR00T를 포함한 다양한 SOTA 모델과 호환됩니다.
  • 하드웨어 불가지론(Hardware Agnostic): NVIDIA GPU와 Kunlun XPU를 모두 네이티브로 지원합니다.
  • 획기적인 속도 향상: 베이스라인 대비 상당한 학습 가속을 입증했습니다 (예: DeepSeek-V3.2 Lite에서 5.04배).
  • 유연한 구성: 교체 가능한 구성 요소를 통해 구성 기반(Configuration-driven)으로 VLM을 조립할 수 있습니다.
  • 원활한 체크포인팅: Megatron과 HuggingFace 형식 간의 양방향 변환을 지원합니다.