專為美術館、圖書館、檔案館與博物館設計的 Hugging Face Hub
什麼是 Hugging Face Hub
Hugging Face Hub 是一個中央儲存庫,人們可以在這裡分享並存取機器學習模型、資料集和演示(demos)。它託管了超過 190,000 個機器學習模型、33,000 個資料集,以及超過 100,000 個機器學習應用程式和演示。這些資源涵蓋了廣泛的任務和領域,包括預訓練語言模型、文本、圖像和音訊分類、目標檢測以及生成模型。
您可以在 Hugging Face Hub 找到什麼
Hub 提供對支援各種模態和任務的機器學習模型、資料集和 Spaces 的存取權限。
模型
Hub 提供涵蓋各種任務和領域的機器學習模型。許多機器學習函式庫都與 Hub 整合,允許使用者透過這些函式庫直接使用或分享模型。
資料集
Hub 託管了超過 30,000 個資料集。這些資料集涵蓋了各種領域和模態,包括文本、圖像、音訊和多模態資料集,對於訓練和評估機器學習模型非常有價值。
Spaces
Hugging Face Spaces 是一個允許使用者託管機器學習演示和應用程式的平台。Spaces 的範圍從探索模型預測的簡單演示到更複雜的應用程式。使用者可以託管 Gradio 和 Streamlit 應用程式,或使用自定義 Docker 鏡像,並可以使用 Docker 範本快速創建熱門工具(如 Argilla 和 Label Studio)的託管版本。
如何在 Hub 上找到相關模型
使用者可以透過按任務和語言篩選 Hub,來找到符合其目標的公開分享模型。
例如,在處理具有極少元數據的數位化挪威文件時,命名實體識別(NER)模型可以幫助識別文本中提到的地點。使用者可以透過 token-classification 任務(包含 NER 模型)來篩選模型,並進一步透過語言 Norwegian 來縮小範圍。許多這類模型都包含一個模型小工具,讓使用者可以在自己的數據上測試性能。選擇模型後,使用者可以點擊 "use in Transformers" 按鈕以獲取使用 Transformers 函式庫載入模型的代碼,或者點擊 "deploy" 按鈕來探索在 API 後端託管模型的選項。
實作指南:將 GLAM 資料集添加到 Hub
無需編寫代碼,即可透過瀏覽器介面將 GLAM 資料集添加到 Hub。
創建新的資料集儲存庫
第一步是在 Hub 右上角的下拉選單中點擊 "New Dataset" 按鈕,為儲存庫選擇一個名稱,選擇一個所有者組織(選填),並指定一個授權許可證。
上傳檔案
創建儲存庫後,使用者點擊 "Files" 標籤下的 "Add file",選擇要上傳的數據檔案,可以上傳單個或多個檔案。選擇檔案後,使用者提交更改以完成上傳。
添加元數據
添加元數據對於提高資料集的可發現性至關重要。使用者可以使用 Metadata UI 編輯器來編輯元數據,指定授權、語言、標籤和其他欄位。此外,使用者應在 README.md 檔案中概述資料集的構建過程、優點和缺點,該檔案將作為資料集卡片(dataset card)。Hub 提供了一個範本資料集卡片,為有用的資訊提供提示。
資料集預覽
上傳後,Hub 會提供資料集的預覽,這有助於使用者更好地理解其內容。
其他分享資料集的方式
使用者可以參考資料集文件,尋找可能適合特定使用場景的替代方法。
為什麼 GLAM 可能想要使用 Hub
美術館、圖書館、檔案館和博物館有幾個貢獻於 Hub 的動機。
- 接觸新受眾:Hub 是機器學習和 AI 從業者的一個中心目的地,因此分享收藏品可以讓這些收藏品接觸到該受眾並開啟合作機會。
- 社群:Hub 的社群功能允許使用者提問並與分享的材料互動,讓人們可以基於彼此的工作進行開發,並降低該領域使用機器學習的門檻。
- 訓練數據的多樣性:分享特定領域的資料集有助於解決 GLAM 數據缺乏相關訓練數據的問題,從而提高模型在現實世界收藏品上的性能。
- 氣候變遷:分享訓練好的模型可以減少重複工作,從集體上降低與訓練機器學習模型相關的碳足跡。
Hugging Face Hub 的應用範例
幾個與 GLAM 相關的專案已經在使用 Hub 來分享模型、資料集和演示。
BigLAM
BigLAM 是 BigScience 專案的一項倡議,已透過 Hub 提供了超過 30 個與 GLAM 相關的資料集,以提高可訪問性。
Nasjonalbiblioteket AI Lab
挪威國家圖書館的 AI 實驗室正積極使用 Hub,分享了約 120 個模型、23 個資料集和六個機器學習演示。這些內容包括在國家圖書館挪威語文本上訓練的語言模型,以及在薩米語(Sámi languages)上訓練的 Whisper 語音轉文本模型。
Smithsonian Institution
史密森尼學會分享了一個託管在 Hugging Face Spaces 上的應用程式,展示了兩個經過訓練用於識別亞馬遜魚類的機器學習模型。該專案旨在為社群提供更準確測量亞馬遜魚類數量的工具,而 Spaces 演示降低了人們使用這些工具的門檻。
專為美術館、圖書館、檔案館與博物館設計的 Hub 功能
Hub 包含對 GLAM 機構特別有幫助的功能。
- 組織(Organizations):使用者可以在 Hub 上創建一個組織,在專用空間中分享其機構的文物。
- 鑄造 DOI:Hub 支持為模型、資料集和演示發行數位物件識別碼(DOIs),提供期刊、會議和資助者通常要求的持久識別碼。
- 使用情況追蹤:使用者可以查看資料集和模型的每月下載統計數據或總累計下載量,以展示影響力。
- 基於腳本的資料集分享:如果資料集已經託管在其他地方,使用者可以透過 Hub 使用資料集載入腳本來提供存取權限。
- 模型與資料集門檻控制(Gating):Hub 支持門檻控制,允許所有者在需要時為模型和資料集添加存取控制。
我該如何獲得使用 Hub 的幫助
使用者可以在 Hub 文件、資料集分享指南和 Transformers 模型分享指南中找到詳細資訊。如需協助,Hub 提供了一個討論論壇和一個 Discord 社群,使用者可以在其中提問並獲得支持。