visual-layer/fastdup

fastdup is a powerful, free tool designed to rapidly generate valuable insights from image and video datasets. It helps enhance the quality of both images and labels, while significantly reducing data operation costs, all with unmatched scalability.

解决的问题

fastdup 解决了管理与清理大规模视觉数据集的挑战。它帮助用户识别并移除重复项、近似重复项、异常值、错误标注的图像以及低质量图像(如模糊、过暗或过亮的图像),以确保为 AI 模型提供高质量的训练数据。

工作原理

该工具使用优化的 C++ 引擎分析图像和视频数据集,无论数据是否带有标签。它可以在本地或云端处理数据,支持使用来自 TIMM(PyTorch Image Models)或 ONNX 模型(例如 DINOv2)的自定义嵌入来揭示数据集问题。它还提供内置的可视化工具,用于生成重复项、异常值和图像统计信息的图库。

适用人群

专为需要在 MacOS、Linux 和 Windows 上对大规模视觉数据集(从数亿到数十亿张图像)进行整理的数据科学家和机器学习工程师设计。

主要亮点

  • 极强的可扩展性:可在单台 CPU 机器上处理 4 亿张图像,并可扩展至数十亿张。
  • 高性能:优化的 C++ 引擎即使在低资源硬件上也能实现高速处理。
  • 与 Hugging Face 集成:可直接从 Hugging Face Hub 加载和分析数据集。
  • 隐私优先:在本地或私有云基础设施上运行,确保数据始终保留在原处。
  • 全面清理:检测损坏图像、错误标注以及模糊、亮度异常等质量问题。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目