Hugging Face Dataset Hub 搜尋功能更新
Hugging Face 已為 Dataset Hub 推出四個新的搜尋過濾器,以改進研究人員和工程師發現和探索平台上超過 180,000 個公開資料集的方式。這些更新解決了資料集可發現性和視覺化的挑戰,使用戶能夠找到符合訓練和評估 AI 模型特定技術需求的資料。
按模態過濾
使用者現在可以根據資料包含的類型來過濾資料集。模態會根據檔案副檔名和內容由 Hub 自動偵測。支援的模態過濾器包括:
- 文字
- 圖像
- 音訊
- 表格
- 時間序列
- 3D
- 影片
- 地理空間
這些過濾器支援多選,允許使用者找到包含多種模態的資料集,例如結合文字和圖像的資料。
按資料集大小過濾
Dataset Hub 現在允許使用者透過指定最小和最大行數來搜尋資料集。此功能使得從小規模資料集到用於 LLM 預訓練的巨型資料集都能被發現。
在支援的格式中,所有資料集都提供行數。對於資料集中未在中繼資料中明確包含行數的情況,Hugging Face 會根據資料集前 5GB 的內容來估算總行數。
按資料格式過濾
使用者現在可以根據資料的儲存格式來過濾資料集,這對於判斷資料是否需要為特定用途重新格式化至關重要。Hub 強調不同的格式提供不同的權衡:
- Parquet: 提供高效的過濾、分析和高壓縮比,儘管存取單一行需要解碼完整的行群。
- WebDataset: 已針對高資料串流速度進行優化,儘管它缺少某些中繼資料,例如每檔案的行數,這可能會影響多節點訓練的分佈。
- 其他格式: 常見格式包括 JSON Lines、CSV 和原始文字檔案。
按程式庫相容性過濾
Dataset Hub 現在包含用於載入和準備資料的程式庫和工具的過濾器,例如 Pandas、Dask 和 Datasets library。相容性由資料集的格式和大小決定(例如,Dask 會被列為適用於大型 JSON Lines 資料集,這些資料集將超過 Pandas 的記憶體限制)。
為了簡化整合,Hugging Face 提供了使用這些支援工具載入資料集的程式碼片段。
結合搜尋過濾器
所有四個新的過濾器——模態、大小、格式和程式庫——可以相互結合,也可以與現有的過濾器如語言、任務和授權結合。與文字搜尋欄一起使用時,這些結合的過濾器可實現高度特定的資料集發現。