huggingface/datasets

🤗 The largest hub of ready-to-use datasets for AI models with fast, easy-to-use and efficient data manipulation tools

What it solves

🤗 Datasets は、機械学習のためのデータアクセスと準備をシンプルにすることを目的とした軽量ライブラリです。テキスト、音声、画像、動画、3D 医療画像といった異なるモダリティの大規模公開データセットのフォーマットが分散している問題や、ダウンロード・前処理の難しさを解決します。

How it works

このライブラリは load_dataset() 関数を中心とした統一 API を提供し、Hugging Face Hub またはローカルファイルからデータセットをダウンロード・準備できます。Apache Arrow バックエンドを使用したゼロコピーのメモリマップドストレージにより RAM の制限を取り除きます。極めて大規模なデータセット向けに「ストリーミングモード」を提供し、ディスクに全体をダウンロードせずにオンザフライでデータを反復できます。

Who it’s for

PyTorch、TensorFlow、JAX、NumPy、Pandas、Polars などのフレームワークと組み合わせて、データセットのロード、処理、統合を効率的に行いたい ML 実務者、研究者、データサイエンティスト向けです。

Highlights

  • One-line loading: Hugging Face Hub から数千の公開データセットにワンラインで素早くアクセス。
  • Multi-modal support: テキスト、音声、画像、動画、PDF、NIfTI(3D 医療)データをネイティブに扱えます。
  • Streaming mode: 完全ダウンロードせずに大規模データセットを反復し、待ち時間を大幅に短縮。
  • Efficient pre-processing: .map() 関数とマルチプロセス対応により高速・並列データ操作が可能。
  • Multi-framework interoperability: 各種データサイエンスライブラリと ML フレームワーク間のシームレスな変換を実現。
  • Smart caching: キャッシュ結果を自動的に再利用し、冗長な処理を回避します。