InternLM/xtuner
A Next-Generation Training Engine Built for Ultra-Large MoE Models
What it solves
XTuner V1은 초거대 규모의 혼합 전문가(MoE) 모델 학습의 복잡성을 처리하도록 설계된 학습 엔진입니다. 최대 1조(1 trillion) 파라미터에 달하는 모델의 높은 메모리 및 계산 요구 사항을 해결하는 동시에, 하드웨어 전반에 걸쳐 이러한 모델을 확장하기 위한 병렬화 전략을 단순화합니다.
How it works
XTuner V1은 다음과 같은 몇 가지 핵심 기술적 접근 방식을 통해 학습 프로세스를 최적화합니다:
- Dropless Training: 전문가 병렬화(expert parallelism)의 복잡성을 줄여, 200B 규모의 MoE 모델을 병렬화 없이 학습할 수 있게 하고, 600B 모델은 노드 내 병렬화(intra-node parallelism)만 필요하도록 합니다.
- Memory Optimization: 시퀀스 병렬화(sequence parallelism) 없이도 64k 시퀀스 길이로 200B MoE 모델을 학습할 수 있게 하며, DeepSpeed Ulysses를 지원하여 시퀀스 길이의 선형 확장을 지원합니다.
- Hardware Acceleration: 이 엔진은 NVIDIA GPU (FP8/BF16)와 Ascend NPU (BF16) 모두에 최적화되어 있어, 200B 파라미터 이상의 모델에 대해 전통적인 3D 병렬화 방식보다 높은 처리량을 달성할 수 있습니다.
Who it’s for
이 도구는 초거대 MoE 모델을 다루는 AI 연구자 및 엔지니어를 대상으로 하며, 특히 대규모 사전 학습, 인스트럭션 미세 조정(instruction fine-tuning) 및 강화 학습(RL)에 집중하는 전문가들을 위한 것입니다.
Highlights
- Massive Scale Support: 최대 1T 파라미터의 MoE 모델 학습이 가능합니다.
- Multimodal Capabilities: 비전-언어 모델(vision-language model)의 사전 학습 및 지도 미세 조정(supervised fine-tuning)을 위한 완전한 지원을 제공합니다.
- Advanced RL Algorithms: Group Relative Policy Optimization (GRPO)를 구현하였으며, MPO 및 DAPO로 확장 중입니다.
- Cross-Hardware Compatibility: NVIDIA H800 및 Ascend A3 Supernodes에 최적화되어 있습니다.