ByteDance-Seed/VeOmni

VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo

What it solves

VeOmniは、異なるハードウェアアクセラレータ間でシングルおよびマルチモーダルモデルのトレーニングをスケールアップする際の複雑さに対処します。従来のトレーナークラスの硬直性を排除する、柔軟でモジュール式のフレームワークを提供し、開発者が大規模モデル(MoEやオムニモーダルモデルを含む)を効率的にスケールさせながら、トレーニングロジックをより直接的に制御できるようにします。

How it works

VeOmniは、「model-centric distributed recipe zoo」を活用してトレーニング構成を管理します。PyTorchのネイティブ関数といくつかの高度な分散トレーニング技術を利用して、パフォーマンスを最適化します:

  • FSDP2: トレーニングの主要なバックエンドとして使用されます。
  • Sequence Parallelism: Deepspeed Ulysses(asyncおよびnon-asyncモードの両方をサポート)を介して実装されています。
  • Experts Parallelism: 大規模なMixture-of-Experts (MoE) モデルのトレーニングを可能にします。
  • Hardware Compatibility: NVIDIA GPU、AMD ROCm、およびAscend NPUをサポートします。
  • Modular Design: コンポーネントを分離することで、ユーザーがカスタム実装に置き換えたり、構造化されたトレーナークラスの代わりに線形トレーニングスクリプトを使用したりできるようにします。

Who it’s for

大規模なマルチモーダルまたはテキストのみのモデルを事前学習または事後学習する必要があり、高い透明性、ハードウェアの柔軟性、および多様なアクセラレータ間でスケールさせる能力を必要とするAI研究者やエンジニア向けに設計されています。

Highlights

  • Trainer-free approach: トレーニングロジックに対する最大限の透明性と制御を実現するため、線形トレーニングスクリプトをサポートします。
  • Broad Model Support: HuggingFace Transformersと互換性があり、DeepSeek、Llama 3、Qwenシリーズ(VLおよびMoEを含む)、およびWanのようなモデルをサポートします。
  • Multi-Accelerator Support: NVIDIA、AMD、およびAscendハードウェア上で動作します。
  • Advanced Parallelism: 大規模なモデルスケーリングのために、FSDP2、Sequence Parallelism、およびExperts Parallelismを統合しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト