ByteDance-Seed/VeOmni

VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo

What it solves

VeOmni는 다양한 하드웨어 가속기에서 단일 및 멀티모달 모델의 학습을 확장하는 과정의 복잡성을 해결합니다. 기존의 trainer 클래스의 경직성을 제거하는 유연하고 모듈식인 프레임워크를 제공하여, 개발자가 대규모 모델(MoE 및 omni-modality 모델 포함)을 효율적으로 확장하면서 학습 로직을 더욱 직접적으로 제어할 수 있도록 합니다.

How it works

VeOmni는 학습 설정을 관리하기 위해 "model-centric distributed recipe zoo"를 활용합니다. 성능을 최적화하기 위해 PyTorch 네이티브 함수와 여러 고급 분산 학습 기술을 사용합니다:

  • FSDP2: 학습을 위한 주요 백엔드로 사용됩니다.
  • Sequence Parallelism: Deepspeed Ulysses를 통해 구현되었습니다(async 및 non-async 모드 모두 지원).
  • Experts Parallelism: 대규모 Mixture-of-Experts (MoE) 모델의 학습을 것을 가능하게 합니다.
  • Hardware Compatibility: NVIDIA GPU, AMD ROCm, 및 Ascend NPU를 지원합니다.
  • Modular Design: 구성 요소를 분리하여 사용자가 커스텀 구현체로 교체하거나 구조화된 trainer 클래스 대신 선형 학습 스크립트를 사용할 수 있도록 합니다.

Who it’s for

대규모 멀티모달 또는 텍스트 전용 모델을 사전 학습(pre-train)하거나 사후 학습(post-train)해야 하며, 높은 투명성, 하드웨어 유연성, 그리고 다양한 가속기 전반에 걸쳐 확장할 수 있는 능력이 필요한 AI 연구원 및 엔지니어들을 위해 설계되었습니다.

Highlights

  • Trainer-free approach: 학습 로직에 대한 최대의 투명성과 제어권을 제공하기 위해 선형 학습 스크립트를 지원합니다.
  • Broad Model Support: HuggingFace Transformers와 호환되며 DeepSeek, Llama 3, Qwen 시리즈(VL 및 MoE 포함), 그리고 Wan과 같은 모델을 지원합니다.
  • Multi-Accelerator Support: NVIDIA, AMD, 및 Ascend 하드웨어에서 작동합니다.
  • Advanced Parallelism: 대규모 모델 확장을 위해 FSDP2, Sequence Parallelism, 및 Experts Parallelism을 통합합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트