xtuner: 支援高達 1T 參數與多模態訓練的超大型 MoE 模型訓練引擎
xtuner: 支援高達 1T 參數與多模態訓練的超大型 MoE 模型訓練引擎
它解決了什麼問題
XTuner V1 是一款旨在處理超大型混合專家 (Mixture-of-Experts, MoE) 模型訓練複雜性的訓練引擎。它解決了參數規模高達 1 兆 (1 trillion) 的模型對記憶體與運算能力的極高需求,同時簡化了在硬體上擴展這些模型所需的並行策略。
運作原理
XTuner V1 透過幾項關鍵技術方法來優化訓練過程:
- Dropless Training: 它降低了專家並行 (expert parallelism) 的複雜性,使得 200B 規模的 MoE 模型無需該技術即可進行訓練,而 600B 模型僅需節點內並行 (intra-node parallelism)。
- Memory Optimization: 它支援以 64k 序列長度訓練 200B MoE 模型而無需序列並行 (sequence parallelism),同時也支援 DeepSpeed Ulysses 以實現序列長度的線性擴展。
- Hardware Acceleration: 該引擎針對 NVIDIA GPU (FP8/BF16) 與 Ascend NPU (BF16) 進行了優化,對於超過 200B 參數的模型,其達成的高吞吐量可超越傳統的 3D 並行方案。
對象是誰
此工具適用於從事超大型 MoE 模型研究的 AI 研究人員與工程師,特別是專注於大規模預訓練、指令微調 (instruction fine-tuning) 與強化學習 (RL) 的專業人士。
重點特色
- Massive Scale Support: 能夠訓練高達 1T 參數的 MoE 模型。
- Multimodal Capabilities: 完全支援視覺語言模型 (vision-language model) 的預訓練與監督式微調。
- Advanced RL Algorithms: 實作了 Group Relative Policy Optimization (GRPO),並正擴展以包含 MPO 與 DAPO。
- Cross-Hardware Compatibility: 針對 NVIDIA H800 與 Ascend A3 Supernodes 進行了優化。
Sources
- undefinedInternLM/xtuner