xtuner: 支持高达 1T 参数和多模态训练的超大规模 MoE 模型训练引擎
xtuner: 支持高达 1T 参数和多模态训练的超大规模 MoE 模型训练引擎
它解决了什么问题
XTuner V1 是一个旨在处理超大规模混合专家 (MoE) 模型训练复杂性的训练引擎。它解决了参数量达到 1 万亿的模型所带来的高显存和计算需求,同时简化了在硬件上扩展这些模型所需的并行策略。
工作原理
XTuner V1 通过几种关键的技术方法优化了训练过程:
- Dropless Training: 它降低了专家并行的复杂性,使得 200B 规模的 MoE 模型可以在无需专家并行的情况下进行训练,而 600B 模型仅需节点内并行。
- Memory Optimization: 它支持在无需序列并行的情况下,使用 64k 序列长度训练 200B MoE 模型,同时还支持 DeepSpeed Ulysses 以实现序列长度的线性扩展。
- Hardware Acceleration: 该引擎针对 NVIDIA GPU (FP8/BF16) 和 Ascend NPU (BF16) 进行了优化,对于超过 200B 参数的模型,其实现的高吞吐量可以超越传统的 3D 并行方案。
适用人群
该工具适用于从事超大规模 MoE 模型工作的 AI 研究人员和工程师,特别是那些专注于大规模预训练、指令微调和强化学习 (RL) 的人员。
亮点
- Massive Scale Support: 能够训练高达 1T 参数的 MoE 模型。
- Multimodal Capabilities: 全面支持视觉语言模型的预训练和监督微调。
- Advanced RL Algorithms: 实现了 Group Relative Policy Optimization (GRPO),并正在扩展以包含 MPO 和 DAPO。
- Cross-Hardware Compatibility: 针对 NVIDIA H800 和 Ascend A3 Supernodes 进行了优化。
Sources
- undefinedInternLM/xtuner