InternLM/xtuner

A Next-Generation Training Engine Built for Ultra-Large MoE Models

What it solves

XTuner V1 是一款专为处理超大规模混合专家模型 (MoE) 训练复杂性而设计的训练引擎。它解决了参数规模达到 1 万亿的模型的超高内存与计算需求,同时简化了在硬件上扩展这些模型所需的并行策略。

How it works

XTuner V1 通过以下几个关键技术方法来优化训练过程:

  • Dropless Training: 降低了专家并行 (expert parallelism) 的复杂性,使得 200B 规模的 MoE 模型可以在不使用它的情况下进行训练,而 600B 模型仅需节点内并行 (intra-node parallelism)。
  • Memory Optimization: 使得 200B MoE 模型在不需要序列并行 (sequence parallelism) 的情况下,能够以 0 64k 序列长度进行训练,同时还支持 DeepSpeed Ulysses 进行序列长度的线性扩展。
  • Hardware Acceleration: 该引擎针对 NVIDIA GPU (FP8/BF16) 和 Ascend NPU (BF16) 进行了优化,对于超过 200B 参数的模型,其吞吐量可以超越传统的 3D 并行方案。

Who it’s for

该工具旨在为从事超大规模 MoE 模型研究与开发的 AI 研究员与工程师,特别是那些专注于大规模预训练、指令微调和强化学习 (RL) 的人员。

Highlights

  • Massive Scale Support: 能够训练高达 1T 参数的 MoE 模型。

  • Multimodal Capabilities: 完全支持视觉语言模型 (vision-language model) 的预训练与监督式微调。

  • Advanced RL Algorithms: 实现了 Group Relative Policy Optimization (GRPO),并正在扩展以包含 MPO 和 DAPO。

  • Cross-Hardware Compatibility: 针对 NVIDIA H800 和 Ascend A3 Supernodes 进行了优化。