Hugging Face Hub 資料集共享給研究者

Hugging Face Hub 提供一個集中平台,用於託管和共享機器學習資料集,透過整合探索工具、廣泛的函式庫支援和穩健的安全控制,使研究者能夠最大化其工作的影響。此基礎設施被 Google、Nvidia、NASA 和 Stanford 等主要機構使用。

大規模資料集託管與串流

Hugging Face Hub 支持 TB 級規模的資料集,具有高每檔案和每儲存庫限制。為了方便計算資源有限的研究者存取,‚ Datasets 函式庫啟用資料集串流,使用戶能在不下載整個儲存庫的情況下使用資料。

目前,Xet 團隊正在開發後端更新,以將每檔案限制從 50 GB 提高到 500 GB,同時提升儲存和傳輸效率。

整合資料探索工具

Hub 包含幾個內建工具,允許使用者在不需本地下載的情況下直接在瀏覽器中與資料互動:

資料集檢視器

The 資料集檢視器支援多種模態(音訊、圖像、影片)和檔案格式,包括 CSV、JSON 和 Parquet。它具有以下功能:

  • 全文搜尋: Text columns are automatically searchable, enabling users to find specific entries (e.g., searching for specific authors in the Arxiver dataset).
  • 排序: Users can sort data by clicking column headers to identify the most relevant examples.

SQL 主控台

The SQL 主控台是一個互動式瀏覽器編輯器,使用完整的 DuckDB 語法。它允許使用者以一次點擊查詢資料集,並分享或嵌入結果查詢。它支援正則表達式、JSON、列表和嵌入的進階函式。

第三方函式庫整合

在 Hub 上託管的資料集能即時與廣泛使用的開源資料工具相容。許多這些函式庫可透過 hf:// 協議使用單行程式碼載入或串流資料集。支援的函式庫包括:

函式庫 說明 2024 月度 PyPi 下載量
Pandas Python 資料分析工具箱 258M
Spark 分佈式大規模資料處理 29M
Datasets 適用於音訊、電腦視覺和自然語言處理資料集的函式庫 17M
Dask 平行與分布式運算 12M
Polars 基於 OLAP 查詢引擎的 DataFrame 函式庫 8.5M
DuckDB 進程內 SQL OLAP 資料庫 6M
WebDataset 大型資料集的 I/O 管道 871K
Argilla AI 工程師的協作工具 400k

安全與存取控制

為保護敏感資料,Hub 提供三種主要的存取級別:

  • 公開:所有使用者皆可開放存取。
  • 私人:僅限擁有者及其組織存取。
  • 受控:透過自動核准(需要姓名/電子郵件並同意條款)或手動核准(需要擁有者審核)來管理存取。

此外,平台使用多種安全掃描器來保護使用者:

  • 惡意軟體掃描:在每次提交和訪問時檢查檔案。
  • 密鑰掃描:封鎖包含硬編碼環境變數或密鑰的資料集。
  • Pickle 掃描:檢查 pickle 檔案中的 PyTorch 權重匯入。
  • ProtectAI:使用 Guardian 技術來阻止 pickle 和 Keras 檔案中的漏洞利用。

社區影響力與可見度

擁有超過 500 萬活躍的建構者,Hub 透過以下方式促進研究的可重現性與協作:

  • 參與工具:內建討論標籤和多個資料集的組織層級分組。
  • 可發現性:SEO 優化的 URL 以及資料集、相關模型、研究論文和示範之間的清晰關聯。
  • 文件:可自訂的 README 檔案,支援學術引用和詳細描述。

Sources