huggingface/datasets
🤗 The largest hub of ready-to-use datasets for AI models with fast, easy-to-use and efficient data manipulation tools
解決的問題
🤗 Datasets 是一個輕量級程式庫,旨在簡化機器學習資料的存取與準備流程。它消除了手動下載、格式化與預處理大型公開資料集的繁瑣,同時提供統一介面,用於處理各種模態(文字、音訊、影像、影片與3D醫學影像)的公開與本機資料。
工作原理
該程式庫的核心是 load_dataset 函數,允許使用者從 Hugging Face Hub 或本機檔案(CSV、JSON、Parquet 等)載入資料。它使用 Apache Arrow 後端實現零複製記憶體映射儲存,避免在處理巨大資料集時遭遇記憶體限制。對於極大型資料,它提供「串流模式」,可在不下載整個資料集的情況下即時迭代處理範例。
適用對象
適用於需要使用 PyTorch、TensorFlow、JAX、NumPy、Pandas 或 Polars 等框架,將資料集載入、處理並整合至訓練或評估流程中的機器學習實務者與研究人員。
主要特色
- 一行載入:透過 Hugging Face Hub 快速存取數千個公開資料集。
- 多模態支援:原生支援文字、音訊、影像、影片、PDF 與 NIfTI(3D 醫學)檔案。
- 記憶體效率:使用 Apache Arrow 實現零複製儲存與智慧快取,避免重複處理。
- 串流處理:可處理超過可用磁碟空間的資料集。
- 互操作性:在各種資料科學程式庫與機器學習框架之間無縫轉換。
- 平行處理:使用支援多進程的
map函數實現快速資料操作。
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 專案