ByteDance-Seed/VeOmni

VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo

它解决了什么问题

VeOmni 解决了在不同硬件加速器上扩展单模态和多模态模型训练的复杂性。它提供了一个灵活、模块化的框架,打破了传统训练器类的僵化限制,使开发者能够更直接地控制训练逻辑,同时高效地扩展大型模型(包括 MoE 和全模态模型)。

它如何工作

VeOmni 利用“以模型为中心的分布式训练配置库”来管理训练配置。它使用 PyTorch 原生函数以及多种先进的分布式训练技术来优化性能:

  • FSDP2:作为主要后端用于训练。
  • 序列并行:通过 Deepspeed Ulysses 实现(支持异步和非异步模式)。
  • 专家并行:支持大规模混合专家(MoE)模型的训练。
  • 硬件兼容性:支持 NVIDIA GPU、AMD ROCm 和 Ascend NPU。
  • 模块化设计:解耦各个组件,用户可以替换为自定义实现,或使用线性训练脚本而非结构化的训练器类。

适用于谁

专为需要预训练或微调大规模多模态或纯文本模型的 AI 研究人员和工程师设计,要求具备高度透明性、硬件灵活性,并能在多种加速器上实现扩展。

主要亮点

  • 无训练器设计:支持线性训练脚本,实现对训练逻辑的最大透明度和控制力。
  • 广泛的模型支持:兼容 HuggingFace Transformers,支持 DeepSeek、Llama 3、Qwen 系列(包括 VL 和 MoE)、Wan 等模型。
  • 多加速器支持:可在 NVIDIA、AMD 和 Ascend 硬件上运行。
  • 高级并行技术:集成 FSDP2、序列并行和专家并行,实现超大规模模型的扩展。

一个真正灵活且可扩展的训练框架,让开发者能完全掌控训练流程 — @veomni

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目