visual-layer/fastdup

fastdup is a powerful, free tool designed to rapidly generate valuable insights from image and video datasets. It helps enhance the quality of both images and labels, while significantly reducing data operation costs, all with unmatched scalability.

What it solves

Fastdup은 대규모 이미지 및 비디오 데이터세트를 관리·정리·큐레이션하기 위해 설계되었습니다. 데이터세트 노이즈(중복 이미지, 근접 중복, 이상치, 잘못 라벨링된 데이터, 흐리거나 너무 어둡거나 밝은 저품질 이미지) 문제를 해결하여 AI 모델 성능 저하를 방지합니다.

How it works

이 도구는 최적화된 C++ 엔진을 사용해 로컬 또는 클라우드에서 시각 데이터를 분석합니다. 라벨이 있든 없든 데이터세트를 처리할 수 있으며, 자체 내부 분석, TIMM(PyTorch Image Models) 및 ONNX 모델(DINOv2 등) 등 다양한 임베딩 방식을 지원해 특징 벡터를 추출하고 유사도 검색 및 데이터세트 감사를 수행합니다.

Who it’s for

CPU 기반 인프라에서 수천 장에서 수십억 장에 이르는 이미지까지, 고품질 시각 데이터세트를 대규모로 큐레이션해야 하는 데이터 과학자와 ML 엔지니어를 위한 도구입니다.

Highlights

  • Extreme Scalability: 단일 CPU 머신에서 4억 장의 이미지를 처리할 수 있으며, 수십억 장 규모로 확장 가능.
  • Comprehensive Cleaning: 중복, 근접 중복, 이상치 및 잘못된 라벨을 식별.
  • Quality Auditing: 손상된 이미지와 조명이 부족하거나 흐린 이미지를 감지.
  • Privacy-First: 로컬 또는 프라이빗 클라우드 인프라에서 실행되어 데이터 보안을 유지.
  • Integration: Hugging Face Datasets와 연동되며, 커스텀 ONNX 임베딩을 지원합니다.