huggingface/datasets
🤗 The largest hub of ready-to-use datasets for AI models with fast, easy-to-use and efficient data manipulation tools
What it solves
🤗 Datasets 是一個輕量級函式庫,旨在簡化存取與準備機器學習資料的流程。它解決了資料格式分散以及在不同模態(文字、音訊、影像、影片與 3D 醫學影像)下載與前處理大規模公共資料集的困難。
How it works
此函式庫提供以 load_dataset() 為核心的統一 API,讓使用者能從 Hugging Face Hub 或本機檔案下載並準備資料集。它使用 Apache Arrow 後端進行零拷貝記憶體映射儲存,消除 RAM 限制。對於極大型資料集,還提供「串流模式」以即時遍歷資料,無需將整個資料集下載至磁碟。
Who it’s for
此函式庫為需要高效載入、處理並整合資料集至訓練或評估管線的機器學習從業者、研究人員與資料科學家而設,支援 PyTorch、TensorFlow、JAX、NumPy、Pandas 與 Polars 等框架。
Highlights
- One-line loading: 快速透過 Hugging Face Hub 存取數千個公共資料集。
- Multi-modal support: 原生支援文字、音訊、影像、影片、PDF 與 NIfTI(3D 醫學)資料。
- Streaming mode: 在不完整下載的情況下遍歷龐大資料集,顯著縮短等待時間。
- Efficient pre-processing: 使用
.map()函式搭配多程序支援,進行快速平行資料操作。 - Multi-framework interoperability: 在各種資料科學函式庫與機器學習框架之間無縫轉換。
- Smart caching: 自動重用快取結果,避免重複處理。