InternLM/xtuner
A Next-Generation Training Engine Built for Ultra-Large MoE Models
What it solves
XTuner V1 是一款專為處理超大規模混合專家模型 (MoE) 訓練複雜性而設計的訓練引擎。它解決了參數規模達到 1 兆的模型的超高記憶體與運算需求,同時簡化了在硬體上擴展這些模型所需的並行策略。
How it works
XTuner V1 透過以下幾個關鍵技術方法來優化訓練過程:
- Dropless Training: 降低了專家並行 (expert parallelism) 的複雜性,使得 200B 規模的 MoE 模型可以在不使用它的情況下進行訓練,而 600B 模型僅需節點內並行 (intra-node parallelism)。
- Memory Optimization: 支援在不需要序列並行 (sequence parallelism) 的情況下,以 64k 序列長度訓練 200B MoE 模型,同時也支援 DeepSpeed Ulysses 以實現序列長度的線性擴展。
- Hardware Acceleration: 該引擎針對 NVIDIA GPU (FP8/BF16) 與 Ascend NPU (BF16) 進行了優化,對於超過 200B 參數的模型,其吞吐量可以超越傳統的 針對 3D 並行方案的優勢。
Who it’s for
此工具旨在為從事超大規模 MoE 模型研究與開發的 AI 研究員與工程師,特別是專注於大規模預訓練、指令微調與強化學習 (RL) 的人員。
Highlights
- Massive Scale Support: 能夠訓練高達 1T 參數的 MoE 模型。
- Multimodal Capabilities: 完全支援視覺語言模型 (vision-language model) 的預訓練與監督式微調。
- Advanced RL Algorithms: 實作了 Group Relative Policy Optimization (GRPO) 並正在擴展以包含 MPO 與 DAPO。
- Cross-Hardware Compatibility: 針對 NVIDIA H800 與 Ascend A3 Supernodes 進行了優化。"},