huggingface/datasets
🤗 The largest hub of ready-to-use datasets for AI models with fast, easy-to-use and efficient data manipulation tools
해결하는 문제
🤗 Datasets는 기계학습을 위한 데이터 접근과 준비를 간소화하기 위해 설계된 경량 라이브러리입니다. 대규모 공개 데이터셋을 수동으로 다운로드하고 포맷하며 전처리하는 번거로움을 제거하며, 텍스트, 오디오, 이미지, 비디오, 3D 의료 영상 등 다양한 모달리티의 공개 및 로컬 데이터를 통합된 인터페이스로 다룰 수 있도록 제공합니다.
작동 방식
이 라이브러리는 load_dataset 함수를 중심으로 구성되어 있으며, Hugging Face Hub 또는 로컬 파일(CSV, JSON, Parquet 등)에서 데이터를 가져올 수 있습니다. Apache Arrow 백엔드를 사용하여 제로 코피 메모리 매핑 저장을 구현하여, 거대한 데이터셋을 처리할 때 RAM 제한을 피할 수 있습니다. 매우 큰 데이터에 대해서는 전체 데이터셋을 다운로드하지 않고도 예제를 실시간으로 반복 처리할 수 있는 "스트리밍 모드"를 제공합니다.
대상 사용자
PyTorch, TensorFlow, JAX, NumPy, Pandas, Polars 등의 프레임워크를 사용하여 트레이닝 또는 평가 파이프라인에 데이터셋을 로드하고 처리하고 통합하고자 하는 머신러닝 실무자 및 연구자에게 적합합니다.
주요 특징
- 1줄로 로드: Hugging Face Hub를 통해 수천 개의 공개 데이터셋을 빠르게 접근 가능.
- 다중 모달리티 지원: 텍스트, 오디오, 이미지, 비디오, PDF, NIfTI(3D 의료) 파일을 네이티브로 처리.
- 메모리 효율성: Apache Arrow를 사용해 제로 코피 저장 및 스마트 캐싱을 통해 중복 처리를 방지.
- 스트리밍: 사용 가능한 디스크 공간보다 큰 데이터셋을 처리할 수 있음.
- 상호 운용성: 다양한 데이터 과학 라이브러리와 ML 프레임워크 간 원활한 변환 가능.
- 병렬 처리: 멀티프로세싱을 지원하는
map함수를 사용해 빠른 데이터 조작 가능.
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 프로젝트