flexflow/flexflow-train

Automatically Discovering Fast Parallelization Strategies for Distributed Deep Neural Network Training

解决的问题

FlexFlow Train 解决了优化分布式深度神经网络(DNN)训练的挑战。开发者无需手动配置复杂的并行化策略,该框架会自动搜索在硬件之间高效分配工作负载的最佳方式。

工作原理

该框架使用自动调优过程来发现最优的并行化策略。它支持从 PyTorch、TensorFlow Keras 和 ONNX 导入模型,然后搜索数据和模型参数的最佳分布方式。支持多种并行类型,包括数据并行、模型并行、参数并行和属性并行,并提供 Python 和 C++ 接口用于实现。

适用人群

专为需要在多个 GPU 或节点上扩展训练,并希望在不手动调整并行化设置的情况下最大化硬件性能的深度学习研究人员和工程师设计。

主要亮点

  • 自动并行化搜索:自动发现可加速分布式训练的高效策略。
  • 广泛兼容性:支持从 PyTorch、TensorFlow Keras 和 ONNX 导入模型。
  • 灵活的并行化:探索数据并行、模型并行、参数并行和属性并行。
  • 多语言支持:提供 Python 和 C++ API 用于开发。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目