Hugging Face Hub 資料集共享給研究者
Hugging Face Hub 提供一個集中平台,用於託管和共享機器學習資料集,透過整合探索工具、廣泛的函式庫支援和穩健的安全控制,使研究者能夠最大化其工作的影響。此基礎設施被 Google、Nvidia、NASA 和 Stanford 等主要機構使用。
大規模資料集託管與串流
Hugging Face Hub 支持 TB 級規模的資料集,具有高每檔案和每儲存庫限制。為了方便計算資源有限的研究者存取, Datasets 函式庫啟用資料集串流,使用戶能在不下載整個儲存庫的情況下使用資料。
目前,Xet 團隊正在開發後端更新,以將每檔案限制從 50 GB 提高到 500 GB,同時提升儲存和傳輸效率。
整合資料探索工具
Hub 包含幾個內建工具,允許使用者在不需本地下載的情況下直接在瀏覽器中與資料互動:
資料集檢視器
The 資料集檢視器支援多種模態(音訊、圖像、影片)和檔案格式,包括 CSV、JSON 和 Parquet。它具有以下功能:
- 全文搜尋: Text columns are automatically searchable, enabling users to find specific entries (e.g., searching for specific authors in the Arxiver dataset).
- 排序: Users can sort data by clicking column headers to identify the most relevant examples.
SQL 主控台
The SQL 主控台是一個互動式瀏覽器編輯器,使用完整的 DuckDB 語法。它允許使用者以一次點擊查詢資料集,並分享或嵌入結果查詢。它支援正則表達式、JSON、列表和嵌入的進階函式。
第三方函式庫整合
在 Hub 上託管的資料集能即時與廣泛使用的開源資料工具相容。許多這些函式庫可透過 hf:// 協議使用單行程式碼載入或串流資料集。支援的函式庫包括:
| 函式庫 | 說明 | 2024 月度 PyPi 下載量 |
|---|---|---|
| Pandas | Python 資料分析工具箱 | 258M |
| Spark | 分佈式大規模資料處理 | 29M |
| Datasets | 適用於音訊、電腦視覺和自然語言處理資料集的函式庫 | 17M |
| Dask | 平行與分布式運算 | 12M |
| Polars | 基於 OLAP 查詢引擎的 DataFrame 函式庫 | 8.5M |
| DuckDB | 進程內 SQL OLAP 資料庫 | 6M |
| WebDataset | 大型資料集的 I/O 管道 | 871K |
| Argilla | AI 工程師的協作工具 | 400k |
安全與存取控制
為保護敏感資料,Hub 提供三種主要的存取級別:
- 公開:所有使用者皆可開放存取。
- 私人:僅限擁有者及其組織存取。
- 受控:透過自動核准(需要姓名/電子郵件並同意條款)或手動核准(需要擁有者審核)來管理存取。
此外,平台使用多種安全掃描器來保護使用者:
- 惡意軟體掃描:在每次提交和訪問時檢查檔案。
- 密鑰掃描:封鎖包含硬編碼環境變數或密鑰的資料集。
- Pickle 掃描:檢查 pickle 檔案中的 PyTorch 權重匯入。
- ProtectAI:使用 Guardian 技術來阻止 pickle 和 Keras 檔案中的漏洞利用。
社區影響力與可見度
擁有超過 500 萬活躍的建構者,Hub 透過以下方式促進研究的可重現性與協作:
- 參與工具:內建討論標籤和多個資料集的組織層級分組。
- 可發現性:SEO 優化的 URL 以及資料集、相關模型、研究論文和示範之間的清晰關聯。
- 文件:可自訂的 README 檔案,支援學術引用和詳細描述。