研究者向け Hugging Face Hub データセット共有
Hugging Face Hub は中央集権型プラットフォームを提供し、機械学習データセットのホスティングと共有を行います。これにより、統合された探索ツール、広範なライブラリサポート、および堅牢なセキュリティコントロールを通じて研究者が自分の仕事の影響を最大化できるようになります。このインフラストラクチャは、Google、Nvidia、NASA、スタンフォードなどの主要な機関で使用されています。
大規模データセットホスティングとストリーミング
Hugging Face Hub はテラバイトスケールのデータセットをサポートし、ファイルおよびリポジトリあたりの制限が高いです。計算リソースが限られた研究者のアクセシビリティを向上させるため、 Datasets ライブラリはデータセットストリーミングを可能にし、ユーザーはリポジトリ全体をダウンロードせずにデータを扱うことができます。
現在、Xet チームは、ストレージと転送効率を向上させながら、ファイルあたりの制限を 50 GB から 500 GB に増やすバックエンドアップデートを開発しています。
統合データ探索ツール
Hub には、ローカルダウンロードを必要とせずにブラウザーで直接データと対話できる組み込みツールがいくつか含まれています:
Dataset Viewer
Dataset Viewer は、オーディオ、画像、ビデオなどの複数のモダリティおよび CSV、JSON、Parquet などのファイル形式をサポートします。特徴は次のとおりです:
- 全文検索: テキスト列は自動的に検索可能であり、ユーザーは特定のエントリを見つけることができます(例:Arxiver データセットで特定の著者を検索するなど)。
- ソート: ユーザーは列ヘッダーをクリックしてデータをソートし、最も関連性の高い例を特定できます。
SQL Console
SQL Console は、完全な DuckDB 構文を使用するインタラクティブなブラウザベースのエディターです。ワンクリックでデータセットをクエリし、結果のクエリ結果を共有または埋め込むことができます。正規表現、JSON、リスト、埋め込みなどの高度な関数をサポートします。
サードパーティライブラリ統合
Hub 上でホストされるデータセットは、広く使用されているオープンソースデータツールとすぐに互換性があります。これらのライブラリの多くは、hf:// プロトコルを使用して 1 行のコードでデータセットのロードまたはストリーミングを可能にします。サポートされているライブラリを含みます:
| ライブラリ | 説明 | 2024 月間 PyPi ダウンロード数 |
|---|---|---|
| Pandas | Python データ分析ツールキット | 258M |
| Spark | 分散大規模データ処理 | 29M |
| Datasets | オーディオ、CV、NLP データセット用ライブラリ | 17M |
| Dask | 並列および分散コンピューティング | 12M |
| Polars | OLAP クエリエンジン上の DataFrame ライブラリ | 8.5M |
| DuckDB | インプロセス SQL OLAP データベース | 6M |
| WebDataset | 大規模データセット向け I/O パイプライン | 871K |
| Argilla | AI エンジニア向けコラボレーションツール | 400k |
セキュリティとアクセス制御
機密データを保護するため、Hub は 3 つの主要なアクセスレベルを提供します:
- 公開: すべてのユーザーがアクセス可能。
- プライベート: オーナーおよびその組織にアクセスが制限されます。
- ゲート付き: 自動承認(名前/メールおよび利用規約への同意が必要)または手動承認(オーナーのレビューが必要)によってアクセスが管理されます。
さらに、プラットフォームはユーザーを保護するためにいくつかのセキュリティスキャナーを採用しています:
- マルウェアスキャン: 各コミットおよび訪問時にファイルをチェックします。
- シークレットスキャン: ハードコードされた環境変数またはシークレットを含むデータセットをブロックします。
- ピクルスキャン: ピクルファイル内の PyTorch 重みのインポートを検証します。
- ProtectAI: ガーディアンテクノロジーを使用して、ピクルおよび Keras ファイルのエクスプロイトをブロックします。
コミュニティのリーチと可視性
500 万人以上のアクティブなビルダーがいる中、Hub は次の方法で研究の再現性とコラボレーションを促進します:
- エンゲージメントツール: 複数のデータセットに対する組み込みディスカッションタブおよび組織レベルのグループ化。
- 見つけやすさ: SEO 最適化された URL と、データセット、関連モデル、研究論文、デモ間の明確なリンク。
- ドキュメンテーション: 学術的引用と詳細な説明をサポートするカスタマイズ可能な README ファイル。