visual-layer/fastdup

fastdup is a powerful, free tool designed to rapidly generate valuable insights from image and video datasets. It helps enhance the quality of both images and labels, while significantly reducing data operation costs, all with unmatched scalability.

What it solves

Fastdup 旨在管理、清理和策划大规模图像与视频数据集。它解决了数据集噪声的问题——例如重复图像、近似重复、异常值、标记错误的数据,以及低质量图像(模糊、过暗或过亮)——这些都会降低 AI 模型的性能。

How it works

该工具使用优化的 C++ 引擎,在本地或云端分析视觉数据。它可以处理有标签或无标签的数据集,并支持多种嵌入方法,包括内部分析、TIMM(PyTorch Image Models)以及 ONNX 模型(如 DINOv2),用于提取特征向量进行相似度搜索和数据集审计。

Who it’s for

它面向需要在规模上策划高质量视觉数据集的数据科学家和机器学习工程师,支持从小规模数据集到数十亿张图像的 CPU 基础设施。

Highlights

  • Extreme Scalability: 能在单台 CPU 机器上处理 4 亿张图像,并可扩展至数十亿张。
  • Comprehensive Cleaning: 识别重复、近似重复、异常和错误标记。
  • Quality Auditing: 检测损坏的图像以及光线不足或模糊的图像。
  • Privacy-First: 可在本地或私有云基础设施上运行,确保数据安全。
  • Integration: 与 Hugging Face Datasets 集成,并支持自定义 ONNX 嵌入。