xtuner: 1조 파라미터까지 지원하고 멀티모달 학습이 가능한 초대형 MoE 모델을 위한 학습 엔진

xtuner: 1조 파라미터까지 지원하고 멀티모달 학습이 가능한 초대형 MoE 모델을 위한 학습 엔진

해결하고자 하는 문제

XTuner V1은 초대형 규모의 Mixture-of-Experts (MoE) 모델 학습 복잡성을 처리하도록 설계된 학습 엔진입니다. 최대 1조 파라미터에 달하는 모델의 높은 메모리 및 연산 요구사항을 해결하면서, 이러한 모델을 하드웨어에 걸쳐 확장하기 위해 필요한 병렬화 전략을 단순화합니다.

작동 방식

XTuner V1은 여러 핵심 기술 접근법을 통해 학습 과정을 최적화합니다:

  • Dropless Training: 전문가 병렬화의 복잡성을 낮춰 200B 규모 MoE 모델은 전문가 병렬 없이, 600B 모델은 노드 내부 병렬만으로 학습할 수 있게 합니다.
  • Memory Optimization: 시퀀스 병렬 없이도 64k 시퀀스 길이의 200B MoE 모델 학습을 가능하게 하며, DeepSpeed Ulysses를 지원해 시퀀스 길이의 선형 스케일링을 제공합니다.
  • Hardware Acceleration: 엔진은 NVIDIA GPU(FP8/BF16)와 Ascend NPU(BF16) 모두에 최적화되어 200B 파라미터 이상 모델에 대해 기존 3D 병렬 방식보다 높은 처리량을 달성합니다.

대상 사용자

이 도구는 초대형 MoE 모델을 다루는 AI 연구자 및 엔지니어를 위한 것으로, 특히 대규모 사전 학습, 지시 기반 파인튜닝, 강화 학습(RL)에 초점을 맞춘 경우에 적합합니다.

주요 특징

  • 대규모 지원: 최대 1조 파라미터 MoE 모델 학습 가능
  • 멀티모달 기능: 비전-언어 모델 사전 학습 및 지도 파인튜닝 완전 지원
  • 고급 RL 알고리즘: Group Relative Policy Optimization (GRPO)을 구현하고 있으며, MPO와 DAPO를 추가로 포함할 예정
  • 크로스 하드웨어 호환성: NVIDIA H800 및 Ascend A3 슈퍼노드 모두에 최적화

Sources