flexflow/flexflow-train

Automatically Discovering Fast Parallelization Strategies for Distributed Deep Neural Network Training

해결하는 문제

FlexFlow Train은 분산 딥 뉴럴 네트워크(DNN) 학습 최적화의 과제를 해결합니다. 개발자가 복잡한 병렬화 전략을 수동으로 구성할 필요 없이, 하드웨어에 작업 부하를 가장 효율적으로 분산하는 방법을 자동으로 탐색합니다.

작동 방식

이 프레임워크는 자동 튜닝 과정을 사용하여 최적의 병렬화 전략을 발견합니다. PyTorch, TensorFlow Keras, ONNX에서 모델을 가져올 수 있으며, 데이터와 모델 파라미터의 최적 분배를 탐색합니다. 데이터 병렬, 모델 병렬, 파라미터 병렬, 속성 병렬을 포함한 다양한 병렬화 유형을 지원하며, 개발을 위한 Python 및 C++ 인터페이스를 제공합니다.

대상 사용자

여러 GPU 또는 노드에 걸쳐 학습을 확장해야 하며, 병렬화 설정을 수동으로 튜닝하지 않고도 하드웨어 성능을 극대화하고자 하는 딥러닝 연구자 및 엔지니어를 위한 것입니다.

주요 특징

  • 자동 병렬화 탐색: 분산 학습을 가속화하는 효율적인 전략을 자동으로 찾습니다.
  • 광범위한 호환성: PyTorch, TensorFlow Keras, ONNX에서 모델을 가져올 수 있습니다.
  • 유연한 병렬화: 데이터 병렬, 모델 병렬, 파라미터 병렬, 속성 병렬을 탐색합니다.
  • 다중 언어 지원: 개발을 위한 Python 및 C++ API를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트