visual-layer/fastdup

fastdup is a powerful, free tool designed to rapidly generate valuable insights from image and video datasets. It helps enhance the quality of both images and labels, while significantly reducing data operation costs, all with unmatched scalability.

What it solves

Fastdup は、大規模な画像・動画データセットの管理、クリーンアップ、キュレーションを目的に設計されたツールです。データセットのノイズ(重複画像、類似重複、外れ値、誤ラベルデータ、ぼやけや暗すぎ・明るすぎる低品質画像)を除去し、AI モデルの性能低下を防ぎます。

How it works

このツールは最適化された C++ エンジンを使用し、ローカルまたはクラウド上でビジュアルデータを解析します。ラベル付き・ラベルなしのデータセットを処理でき、内部解析、TIMM(PyTorch Image Models)および ONNX モデル(例:DINOv2)など、さまざまな埋め込み手法をサポートして特徴ベクトルを抽出し、類似検索やデータセット監査に利用します。

Who it’s for

CPU ベースのインフラ上で、数千枚から数十億枚規模の画像まで、高品質なビジュアルデータセットを大規模にキュレーションしたいデータサイエンティストや ML エンジニア向けです。

Highlights

  • Extreme Scalability: 単一 CPU マシンで 4 億枚の画像を処理でき、さらに数十億枚規模へスケール可能。
  • Comprehensive Cleaning: 重複、類似重複、外れ値、誤ラベルを検出。
  • Quality Auditing: 破損画像や照明不足・ぼやけた画像を検出。
  • Privacy-First: ローカルまたはプライベートクラウドで実行し、データを安全に保護。
  • Integration: Hugging Face Datasets と連携し、カスタム ONNX 埋め込みもサポート。