研究者向け Hugging Face Hub データセット共有

Hugging Face Hub は中央集権型プラットフォームを提供し、機械学習データセットのホスティングと共有を行います。これにより、統合された探索ツール、広範なライブラリサポート、および堅牢なセキュリティコントロールを通じて研究者が自分の仕事の影響を最大化できるようになります。このインフラストラクチャは、Google、Nvidia、NASA、スタンフォードなどの主要な機関で使用されています。

大規模データセットホスティングとストリーミング

Hugging Face Hub はテラバイトスケールのデータセットをサポートし、ファイルおよびリポジトリあたりの制限が高いです。計算リソースが限られた研究者のアクセシビリティを向上させるため、‚ Datasets ライブラリはデータセットストリーミングを可能にし、ユーザーはリポジトリ全体をダウンロードせずにデータを扱うことができます。

現在、Xet チームは、ストレージと転送効率を向上させながら、ファイルあたりの制限を 50 GB から 500 GB に増やすバックエンドアップデートを開発しています。

統合データ探索ツール

Hub には、ローカルダウンロードを必要とせずにブラウザーで直接データと対話できる組み込みツールがいくつか含まれています:

Dataset Viewer

Dataset Viewer は、オーディオ、画像、ビデオなどの複数のモダリティおよび CSV、JSON、Parquet などのファイル形式をサポートします。特徴は次のとおりです:

  • 全文検索: テキスト列は自動的に検索可能であり、ユーザーは特定のエントリを見つけることができます(例:Arxiver データセットで特定の著者を検索するなど)。
  • ソート: ユーザーは列ヘッダーをクリックしてデータをソートし、最も関連性の高い例を特定できます。

SQL Console

SQL Console は、完全な DuckDB 構文を使用するインタラクティブなブラウザベースのエディターです。ワンクリックでデータセットをクエリし、結果のクエリ結果を共有または埋め込むことができます。正規表現、JSON、リスト、埋め込みなどの高度な関数をサポートします。

サードパーティライブラリ統合

Hub 上でホストされるデータセットは、広く使用されているオープンソースデータツールとすぐに互換性があります。これらのライブラリの多くは、hf:// プロトコルを使用して 1 行のコードでデータセットのロードまたはストリーミングを可能にします。サポートされているライブラリを含みます:

ライブラリ 説明 2024 月間 PyPi ダウンロード数
Pandas Python データ分析ツールキット 258M
Spark 分散大規模データ処理 29M
Datasets オーディオ、CV、NLP データセット用ライブラリ 17M
Dask 並列および分散コンピューティング 12M
Polars OLAP クエリエンジン上の DataFrame ライブラリ 8.5M
DuckDB インプロセス SQL OLAP データベース 6M
WebDataset 大規模データセット向け I/O パイプライン 871K
Argilla AI エンジニア向けコラボレーションツール 400k

セキュリティとアクセス制御

機密データを保護するため、Hub は 3 つの主要なアクセスレベルを提供します:

  • 公開: すべてのユーザーがアクセス可能。
  • プライベート: オーナーおよびその組織にアクセスが制限されます。
  • ゲート付き: 自動承認(名前/メールおよび利用規約への同意が必要)または手動承認(オーナーのレビューが必要)によってアクセスが管理されます。

さらに、プラットフォームはユーザーを保護するためにいくつかのセキュリティスキャナーを採用しています:

  • マルウェアスキャン: 各コミットおよび訪問時にファイルをチェックします。
  • シークレットスキャン: ハードコードされた環境変数またはシークレットを含むデータセットをブロックします。
  • ピクルスキャン: ピクルファイル内の PyTorch 重みのインポートを検証します。
  • ProtectAI: ガーディアンテクノロジーを使用して、ピクルおよび Keras ファイルのエクスプロイトをブロックします。

コミュニティのリーチと可視性

500 万人以上のアクティブなビルダーがいる中、Hub は次の方法で研究の再現性とコラボレーションを促進します:

  • エンゲージメントツール: 複数のデータセットに対する組み込みディスカッションタブおよび組織レベルのグループ化。
  • 見つけやすさ: SEO 最適化された URL と、データセット、関連モデル、研究論文、デモ間の明確なリンク。
  • ドキュメンテーション: 学術的引用と詳細な説明をサポートするカスタマイズ可能な README ファイル。

Sources