Hugging Face 與 Argilla 讓社群共同構建資料集
Hugging Face 與 Argilla 發起了一項計畫,讓開源社群能共同構建高品質的資料集,降低非技術貢獻者的參與門檻。此舉旨在解決許多語言、領域與特定任務缺乏高品質訓練、評估與基準測試資料的問題。
透過 Argilla 與 Hugging Face Spaces 進行共同資料集構建
共同資料集構建讓沒有機器學習或程式設計技能的個人也能直接參與開源機器學習的開發。透過精簡的技術工作流程,社群可以協作各種資料類型,包括:
- 特定語言聊天資料集:為被低估的語言創建資料。
- 領域特定基準:為專業領域開發評估資料集。
- 偏好資料集:收集多元參與者的排名。
- 任務特定資料集:構建針對特定機器學習任務的資料。
技術實作與工作流程
過去共同資料標註的主要技術障礙是建立高效標註任務的困難。透過結合 Argilla——一個用於建立大型語言模型與任務特定資料集的開源工具——與 Hugging Face Spaces(用於託管機器學習示範與應用的平台),此問題得以解決。
Argilla 現已支援透過 Hugging Face 帳號在 Spaces 上的實例進行驗證。此整合讓使用者能在數秒內開始參與標註任務,顯著降低社群參與的阻礙。
概念驗證:10k_prompts_ranked 資料集
為測試此工作流程,Hugging Face 與 Argilla 進行了一項名為「Data is Better Together」的實驗,專注於構建提示排名的偏好資料集。結果顯示了社群驅動方法的高效性:
- 貢獻者數量:有 350 位社群貢獻者參與資料標記。
- 資料量:在數天內收集了超過 11,000 筆提示評分。
- 成果:發布
10k_prompts_ranked資料集,包含 10,000 個提示及使用者對提示品質的評分。
社群同儕支援
Hugging Face 與 Argilla 正在招募首批社群資料集建構者,以擴大此模式。此同儕的參與者將獲得以下支援:
- 基礎設施:協助建立具 Hugging Face 驗證的 Argilla Space,包含 Hugging Face 提供的免費永久儲存與升級 CPU 空間。
- 能見度:由 Argilla 與 Hugging Face 共同放大宣傳與推廣。
- 協作:取得專屬同儕社群頻道的存取權。
計畫範圍與限制
此計畫主要聚焦於文字資料集,特別是針對目前在開源生態系中被低估的語言、領域與任務。雖然計畫接受多模態資料集的想法,但在首批同儕期間對其支援可能有限。標註任務可設定為完全公開給大眾,或僅限特定 Hugging Face Hub 組織的成員參與。