huggingface/datasets

🤗 The largest hub of ready-to-use datasets for AI models with fast, easy-to-use and efficient data manipulation tools

What it solves

🤗 Datasets 是一个轻量级库,旨在简化访问和准备机器学习数据的过程。它解决了数据格式碎片化以及在不同模态(文本、音频、图像、视频和 3D 医学影像)下载和预处理大规模公共数据集的困难。

How it works

该库提供以 load_dataset() 为核心的统一 API,允许用户从 Hugging Face Hub 或本地文件下载并准备数据集。它使用 Apache Arrow 后端进行零拷贝内存映射存储,消除 RAM 限制。对于极大型数据集,还提供“流式模式”,可以即时遍历数据,无需将整个数据集下载到磁盘。

Who it’s for

它面向需要高效加载、处理并将数据集集成到训练或评估流水线的机器学习实践者、研究人员和数据科学家,支持 PyTorch、TensorFlow、JAX、NumPy、Pandas 与 Polars 等框架。

Highlights

  • One-line loading: 快速通过 Hugging Face Hub 访问数千个公共数据集。
  • Multi-modal support: 原生支持文本、音频、图像、视频、PDF 与 NIfTI(3D 医学)数据。
  • Streaming mode: 在不完整下载的情况下遍历庞大数据集,显著减少等待时间。
  • Efficient pre-processing: 使用 .map() 函数并支持多进程,实现快速并行数据操作。
  • Multi-framework interoperability: 在各种数据科学库与机器学习框架之间无缝转换。
  • Smart caching: 自动复用缓存结果,避免冗余处理。