open-gigaai/giga-datasets

GigaDatasets: A Unified and Lightweight Framework for Data Processing, Curation, and Visualization

해결하는 문제

GigaDatasets는 AI 학습 및 추론에 사용되는 대규모 데이터셋을 관리하기 위한 통합적이고 가벼운 프레임워크를 제공합니다. 데이터 커레이션, 패키징, 로딩, 평가의 복잡한 과정을 단순화하여 다양한 데이터 형식과 구조 간의 일관성을 보장합니다.

작동 방식

이 프레임워크는 데이터 파이프라인의 각 단계에 맞는 전용 도구 세트를 통해 작동합니다:

  • 데이터 패키징: PklWriter, FileWriter, LmdbWriter 등의 Writer 클래스를 사용하여 이미지나 JSON 어노테이션과 같은 비구조화된 원시 데이터를 구조화되고 효율적인 형식으로 변환합니다.
  • 데이터 로딩: 하나의 load_dataset 함수를 통해 기반 스토리지 형식에 관계없이 데이터셋을 로드할 수 있습니다.
  • 데이터 평가: FIDEvaluator를 통해 예측 결과를 데이터셋과 비교하여 간편하게 평가할 수 있습니다.
  • 확장성: 새로운 데이터 필드(예: 기존 데이터셋에 Canny 맵 추가)를 쉽게 추가할 수 있도록 설계되어, 다양한 모델 요구사항에 대응할 수 있습니다.

대상 사용자

이 프레임워크는 이미지, 동영상, 2D/3D 박스, 2D/3D 포인트 등의 대규모 멀티모달 데이터를 다루는 AI 연구자 및 개발자, 그리고 LeRobot 데이터셋을 사용하는 사용자를 대상으로 합니다.

주요 특징

  • 통합 워크플로우: 커레이션, 패키징, 로딩, 평가를 하나의 시스템으로 통합.
  • 다양한 형식 지원: File, LMDB, Pickle, LeRobot 데이터셋과 호환.
  • 고성능: 대규모 처리 시 속도와 메모리 효율이 최적화됨.
  • 간단한 API: 단일 코드 줄로 데이터셋 로딩 및 평가가 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트