flexflow/flexflow-train
Automatically Discovering Fast Parallelization Strategies for Distributed Deep Neural Network Training
해결하는 문제
FlexFlow Train은 분산 딥 뉴럴 네트워크(DNN) 학습 최적화의 과제를 해결합니다. 개발자가 복잡한 병렬화 전략을 수동으로 구성할 필요 없이, 하드웨어에 작업 부하를 가장 효율적으로 분산하는 방법을 자동으로 탐색합니다.
작동 방식
이 프레임워크는 자동 튜닝 과정을 사용하여 최적의 병렬화 전략을 발견합니다. PyTorch, TensorFlow Keras, ONNX에서 모델을 가져올 수 있으며, 데이터와 모델 파라미터의 최적 분배를 탐색합니다. 데이터 병렬, 모델 병렬, 파라미터 병렬, 속성 병렬을 포함한 다양한 병렬화 유형을 지원하며, 개발을 위한 Python 및 C++ 인터페이스를 제공합니다.
대상 사용자
여러 GPU 또는 노드에 걸쳐 학습을 확장해야 하며, 병렬화 설정을 수동으로 튜닝하지 않고도 하드웨어 성능을 극대화하고자 하는 딥러닝 연구자 및 엔지니어를 위한 것입니다.
주요 특징
- 자동 병렬화 탐색: 분산 학습을 가속화하는 효율적인 전략을 자동으로 찾습니다.
- 광범위한 호환성: PyTorch, TensorFlow Keras, ONNX에서 모델을 가져올 수 있습니다.
- 유연한 병렬화: 데이터 병렬, 모델 병렬, 파라미터 병렬, 속성 병렬을 탐색합니다.
- 다중 언어 지원: 개발을 위한 Python 및 C++ API를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트