ByteDance-Seed/VeOmni

VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo

它解決的問題

VeOmni 解決了在不同硬體加速器上擴展單模態與多模態模型訓練的複雜性。它提供了一個靈活且模組化的框架,打破了傳統訓練器類別的僵化,讓開發者能更直接地控制訓練邏輯,同時高效地擴展大型模型(包括 MoE 和多模態模型)。

如何運作

VeOmni 利用「以模型為中心的分散式訓練配方庫」來管理訓練設定。它使用 PyTorch 原生功能以及多種先進的分散式訓練技術來優化效能:

  • FSDP2:作為主要後端用於訓練。
  • 序列平行:透過 Deepspeed Ulysses 實作(支援非同步與同步模式)。
  • 專家平行:支援大型混合專家(MoE)模型的訓練。
  • 硬體相容性:支援 NVIDIA GPU、AMD ROCm 與 Ascend NPU。
  • 模組化設計:將各元件解耦,使用者可替換為自訂實作,或使用線性訓練腳本而非結構化訓練器類別。

適用對象

專為需要預訓練或微調大型多模態或純文字模型的人工智慧研究人員與工程師設計,並要求高透明度、硬體彈性,以及跨多樣加速器的擴展能力。

主要特色

  • 無訓練器設計:支援線性訓練腳本,以達到最大透明度與對訓練邏輯的控制。
  • 廣泛的模型支援:相容 HuggingFace Transformers,並支援 DeepSeek、Llama 3、Qwen 系列(含 VL 與 MoE)、Wan 等模型。
  • 多加速器支援:可在 NVIDIA、AMD 與 Ascend 硬體上運作。
  • 先進的平行技術:整合 FSDP2、序列平行與專家平行,以實現大型模型的擴展。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案