ByteDance-Seed/VeOmni
VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo
它解决了什么问题
VeOmni 解决了在不同硬件加速器上扩展单模态和多模态模型训练的复杂性。它提供了一个灵活、模块化的框架,打破了传统训练器类的僵化限制,使开发者能够更直接地控制训练逻辑,同时高效地扩展大型模型(包括 MoE 和全模态模型)。
它如何工作
VeOmni 利用“以模型为中心的分布式训练配置库”来管理训练配置。它使用 PyTorch 原生函数以及多种先进的分布式训练技术来优化性能:
- FSDP2:作为主要后端用于训练。
- 序列并行:通过 Deepspeed Ulysses 实现(支持异步和非异步模式)。
- 专家并行:支持大规模混合专家(MoE)模型的训练。
- 硬件兼容性:支持 NVIDIA GPU、AMD ROCm 和 Ascend NPU。
- 模块化设计:解耦各个组件,用户可以替换为自定义实现,或使用线性训练脚本而非结构化的训练器类。
适用于谁
专为需要预训练或微调大规模多模态或纯文本模型的 AI 研究人员和工程师设计,要求具备高度透明性、硬件灵活性,并能在多种加速器上实现扩展。
主要亮点
- 无训练器设计:支持线性训练脚本,实现对训练逻辑的最大透明度和控制力。
- 广泛的模型支持:兼容 HuggingFace Transformers,支持 DeepSeek、Llama 3、Qwen 系列(包括 VL 和 MoE)、Wan 等模型。
- 多加速器支持:可在 NVIDIA、AMD 和 Ascend 硬件上运行。
- 高级并行技术:集成 FSDP2、序列并行和专家并行,实现超大规模模型的扩展。
一个真正灵活且可扩展的训练框架,让开发者能完全掌控训练流程 — @veomni
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目