flexflow/flexflow-train

Automatically Discovering Fast Parallelization Strategies for Distributed Deep Neural Network Training

何を解決するか

FlexFlow Train は、分散型ディープニューラルネットワーク(DNN)学習の最適化という課題に対処します。開発者が複雑な並列化戦略を手動で設定する必要はなく、ハードウェア全体にワークロードを効率的に分散する最適な方法を自動的に探索します。

動作方法

このフレームワークは自動チューニングプロセスを使用して最適な並列化戦略を発見します。PyTorch、TensorFlow Keras、ONNX からのモデルをインポートでき、データおよびモデルパラメータの最適な分散を探索します。データ並列、モデル並列、パラメータ並列、属性並列の複数の並列化タイプをサポートし、実装には Python と C++ の両方のインターフェースを提供します。

対象ユーザー

複数の GPU やノードにわたって学習をスケーリングする必要があり、並列化設定を手動でチューニングせずにハードウェア性能を最大化したいディープラーニング研究者やエンジニア向けに設計されています。

特徴

  • 自動並列化探索: 分散学習を高速化する効率的な戦略を自動で発見します。
  • 広範な互換性: PyTorch、TensorFlow Keras、ONNX からのモデルインポートをサポートします。
  • 柔軟な並列化: データ並列、モデル並列、パラメータ並列、属性並列を探索します。
  • 多言語対応: 開発用に Python と C++ の両方の API を提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト