open-gigaai/giga-datasets
GigaDatasets: A Unified and Lightweight Framework for Data Processing, Curation, and Visualization
해결하는 문제
GigaDatasets는 AI 학습 및 추론에 사용되는 대규모 데이터셋을 관리하기 위한 통합적이고 가벼운 프레임워크를 제공합니다. 데이터 커레이션, 패키징, 로딩, 평가의 복잡한 과정을 단순화하여 다양한 데이터 형식과 구조 간의 일관성을 보장합니다.
작동 방식
이 프레임워크는 데이터 파이프라인의 각 단계에 맞는 전용 도구 세트를 통해 작동합니다:
- 데이터 패키징:
PklWriter,FileWriter,LmdbWriter등의 Writer 클래스를 사용하여 이미지나 JSON 어노테이션과 같은 비구조화된 원시 데이터를 구조화되고 효율적인 형식으로 변환합니다. - 데이터 로딩: 하나의
load_dataset함수를 통해 기반 스토리지 형식에 관계없이 데이터셋을 로드할 수 있습니다. - 데이터 평가:
FIDEvaluator를 통해 예측 결과를 데이터셋과 비교하여 간편하게 평가할 수 있습니다. - 확장성: 새로운 데이터 필드(예: 기존 데이터셋에 Canny 맵 추가)를 쉽게 추가할 수 있도록 설계되어, 다양한 모델 요구사항에 대응할 수 있습니다.
대상 사용자
이 프레임워크는 이미지, 동영상, 2D/3D 박스, 2D/3D 포인트 등의 대규모 멀티모달 데이터를 다루는 AI 연구자 및 개발자, 그리고 LeRobot 데이터셋을 사용하는 사용자를 대상으로 합니다.
주요 특징
- 통합 워크플로우: 커레이션, 패키징, 로딩, 평가를 하나의 시스템으로 통합.
- 다양한 형식 지원: File, LMDB, Pickle, LeRobot 데이터셋과 호환.
- 고성능: 대규모 처리 시 속도와 메모리 효율이 최적화됨.
- 간단한 API: 단일 코드 줄로 데이터셋 로딩 및 평가가 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트