baidu-baige/LoongForge
A high-performance framework for training LLMs, VLMs, diffusion, and embodied models on NVIDIA GPUs and Kunlun XPUs.
해결하는 문제
LoongForge는 대규모 언어 모델(LLMs), 시각-언어 모델(VLMs), 확산 모델, 그리고 몸을 가진 AI 모델의 학습을 가속화하기 위해 설계된 고성능 학습 프레임워크입니다. 병렬 전략, 메모리 사용량, 커널 효율성을 최적화함으로써 기준 구현과 동일한 학습 손실 곡선을 유지하면서 학습 비용과 시간을 줄이는 것을 목표로 합니다.
작동 방식
LoongForge는 다중 백엔드 아키텍처를 사용하여 다양한 모델 유형에 최적의 학습 전략을 적용합니다.
- Megatron Stack: LLMs, VLMs, 확산 모델용으로 수정된 Megatron-LM 버전입니다. Mixture-of-Experts(MoE) 병렬화, Context Parallel(CP)를 통한 긴 시퀀스 학습, 그리고 적응형 FP8 학습을 위한 최적화가 포함되어 있습니다.
- Torch-Native Stack: VLA 및 WAM용으로 전용 설계된 하위 시스템으로, DDP, ZeRO-1, FSDP, HSDP 전략을 사용하며 Megatron 코어에서 분리되어 로보틱스 중심 모델의 처리량을 극대화합니다.
대상 사용자
다양한 모달리티에서 대규모 기초 모델을 학습하는 연구자 및 엔지니어를 대상으로 합니다. 특히 NVIDIA GPU 또는 Kunlun XPUs를 사용하며, 수천 개의 가속기로 학습을 확장해야 하는 사용자에게 적합합니다.
주요 특징
- MoE 최적화: 작업 부하 균형과 통신 오버헤드를 줄이는 토폴로지 인식형 동적 전문가 복제 배치(TAOT)를 제공합니다.
- 유연한 조합: 사용자 정의 코드 없이 구성 파일을 통해 ViT와 LLM 컴포넌트를 교체 가능하게 하여 VLM을 구성할 수 있습니다.
- 이종 병렬화: ViT와 LLM과 같은 서로 다른 모델 컴포넌트에 대해 독립적인 병렬 설정(TP/DP/재계산)을 지원합니다.
- 몸을 가진 AI 지원: VLA 및 월드 액션 모델(예: Pi0.5, GR00T)을 위한 특화된 학습 및 평가 모듈을 제공합니다.
- 하드웨어 호환성: NVIDIA GPU와 Kunlun XPUs 모두에 네이티브로 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch