facebookresearch/spdl
Scalable and Performant Data Loading
해결하는 문제
대규모 배열 데이터를 처리하기 위한 성능이 뛰어나고 확장 가능한 데이터 로딩 시스템을 설계하는 과제는 머신러닝 파이프라인에서 종종 병목 현상이 됩니다. 이를 해결합니다.
작동 방식
SPDL은 배열 데이터를 효율적으로 처리하도록 설계된 유연한 파이프라인 추상화와 일련의 특화된 연산들을 제공합니다.
대상 사용자
높은 성능과 확장 가능한 데이터 처리량을 보장하기 위해 AI/ML 파이프라인의 데이터 로딩 및 전처리 단계를 최적화해야 하는 연구원 및 엔지니어.
주요 특징
- 확장 가능하고 성능이 뛰어난 데이터 로딩 아키텍처
- 데이터 처리를 위한 유연한 파이프라인 추상화
- 배열 데이터 조작을 위한 특화된 연산
관련
- 프로젝트
IBM/lalescikit-learn 호환 파이프라인을 위한 알고리즘 선택 및 하이퍼파라미터 튜닝을 자동화하는 Python 라이브러리입니다.
- 프로젝트
google/seqio시퀀스 모델을 위한 태스크 기반 데이터셋, 전처리, 평가를 통합된 프레임워크로 제공하는 순차 데이터 처리 라이브러리입니다.
- 프로젝트
microsoft/FLAML최소한의 계산 리소스를 사용하여 고품질의 모델을 찾는 효율적인 자동화 머신러닝 (AutoML) 및 하이퍼파라미터 튜닝을 위한 경량 Python 라이브러리입니다.
- 프로젝트
aws/sagemaker-spark스케일링 가능한 모델 훈련과 DataFrame 기반 추론을 가능하게 하는 오픈소스 Spark 라이브러리로, Amazon SageMaker를 Spark ML 파이프라인에 통합합니다.
- 프로젝트
bespokelabsai/curator확장 가능한 합성 데이터 파이프라인을 구축하기 위한 Python 라이브러리로, 대량 추론 및 구조화된 출력 도구를 제공하여 포스트 트레이닝을 위한 고품질 데이터 세트를 큐레이션합니다.