baidu-baige/LoongForge
A high-performance framework for training LLMs, VLMs, diffusion, and embodied models on NVIDIA GPUs and Kunlun XPUs.
解决的问题
LoongForge 是一个为加速大语言模型(LLMs)、视觉-语言模型(VLMs)、扩散模型以及具身智能模型训练而设计的高性能训练框架。它通过优化并行策略、内存使用和内核效率,在保持与基线实现相同训练损失曲线的同时,旨在降低训练成本和时间。
工作原理
LoongForge 采用多后端架构,为不同模型类型应用最佳训练策略:
- Megatron Stack:专为 LLMs、VLMs 和扩散模型定制的 Megatron-LM 修改版本,包含 Mixture-of-Experts(MoE)并行优化、通过上下文并行(CP)实现长序列训练,以及自适应 FP8 训练优化。
- Torch-Native Stack:专为具身模型(VLA 和 WAM)设计的子系统,使用 DDP、ZeRO-1、FSDP 和 HSDP 策略,与 Megatron 核心解耦,以最大化面向机器人模型的吞吐量。
适用人群
适用于在多种模态上训练大规模基础模型的研究人员和工程师,特别是使用 NVIDIA GPU 或 Kunlun XPUs,并需要将训练扩展到数千个加速器的用户。
主要亮点
- MoE 优化:支持拓扑感知的动态专家副本放置(TAOT),实现负载均衡并减少通信开销。
- 灵活组合:通过配置文件即可组装 VLM,无需编写自定义代码,支持 ViT 与 LLM 组件的互换。
- 异构并行:支持不同模型组件(如 ViT 与 LLM)独立设置并行策略(TP/DP/重计算)。
- 具身智能支持:为 VLA 和世界动作模型(如 Pi0.5、GR00T)提供专用的训练与评估模块。
- 硬件兼容性:原生支持 NVIDIA GPU 和 Kunlun XPUs。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch