visual-layer/fastdup
fastdup is a powerful, free tool designed to rapidly generate valuable insights from image and video datasets. It helps enhance the quality of both images and labels, while significantly reducing data operation costs, all with unmatched scalability.
What it solves
Fastdup 是為了管理、清理與策展大規模影像與影片資料集而設計的工具。它解決了資料集噪聲的問題——例如重複影像、近似重複、異常值、標記錯誤的資料,以及低品質影像(模糊、過暗或過亮)——這些都會降低 AI 模型的效能。
How it works
此工具使用最佳化的 C++ 引擎,在本機或雲端本地分析視覺資料。它能處理有標記或無標記的資料集,並支援多種嵌入方法,包括內建分析、TIMM(PyTorch Image Models)以及 ONNX 模型(如 DINOv2),以提取特徵向量進行相似度搜尋與資料集稽核。
Who it’s for
此工具適用於需要在規模上策展高品質視覺資料集的資料科學家與機器學習工程師,支援從小型資料集到數十億張影像的 CPU 基礎設施。
Highlights
- Extreme Scalability: 能在單一 CPU 機器上處理 4 億張影像,並可擴展至數十億張。
- Comprehensive Cleaning: 識別重複、近似重複、異常與錯誤標記。
- Quality Auditing: 偵測損毀的影像以及光線不足或模糊的影像。
- Privacy-First: 可在本機或私有雲基礎設施上執行,確保資料安全。
- Integration: 可與 Hugging Face Datasets 整合,並支援自訂 ONNX 嵌入。