yandex/YaFSDP
YaFSDP: Yet another Fully Sharded Data Parallel
解决的问题
YaFSDP 旨在优化大语言模型 (LLM) 的预训练,专门针对 Sharded Data Parallelism 中与通信和内存操作相关的开销。它旨在通过提高高内存压力下的 GPU 利用率和性能,提供比 PyTorch FSDP (Fully Sharded Data Parallel) 更快的替代方案。
工作原理
它实现了一个专门针对类 Transformer 神经网络架构调优的 Sharded Data Parallelism 框架。通过减少通信和内存操作开销,它可以在多 GPU 训练运行期间实现更快的迭代时间。
适用对象
使用 Hugging Face 技术栈,在大型 GPU 集群(范围从 64 到 256 个设备)上训练大规模 Transformer 模型(如 Llama 2 和 Llama 3)的机器学习工程师和研究人员。
亮点
- 性能提升:与标准 FSDP 相比,LLM 预训练速度提升高达 20%。
- 可扩展性:在高达 256 个 A100 GPU 上对 7B 到 70B 参数的模型进行了基准测试。
- 可扩展性:支持因果预训练 (causal pre-training) 和监督微调 (SFT)。
- 集成:通过提供的示例和 Docker 镜像与 Hugging Face 生态系统协同工作。
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- Dispatch