Hugging Face 數據共創倡議
概述
在開源機器學習社群的支持下,Hugging Face 與 Argilla 建立了 Data Is Better Together (DIBT) 倡議,以促進有影響力資料集的集體創建。該計畫旨在突破以英語為中心的資料,透過社群驅動的資料策展,並提供開發者與領域專家自行構建高品質資料集所需的工具。
社群驅動的資料集成果
DIBT 倡議聚焦於兩個主要的社群專案,以提升提示品質與多語言評估:
提示排序專案
該倡議成功建立了一個包含 10,000 個提示的資料集,結合合成與人工產生的條目,並依品質進行排序。此工作吸引了超過 385 位參與者,並發布了 DIBT/10k_prompts_ranked 資料集。此資料集用於提示排序任務與合成資料生成,已被用於開發新模型,包括 SPIN。
多語言提示評估專案 (MPEP)
為了解決開源大型語言模型(LLM)缺乏語言特定基準的問題,MPEP 被創建以開發多語言排行榜。該專案從 DIBT/10k_prompts_ranked 資料集中挑選了 500 個高品質提示作為翻譯對象,翻譯成多種語言。此工作取得以下進展:
- 已超過 18 位語言領袖建立了翻譯空間。
- 已完成包括荷蘭語、俄語和西班牙語在內的翻譯,其他語言仍在持續進行中。
- 在 Discord 上已形成一個專門的資料集建構者社群。
資料集建立指南與工具
作為「cookbook」計畫的一部分,DIBT 提供指南與工具,協助社群獨立構建專門化資料集。這些資源聚焦於三個關鍵領域:
- 領域特定資料集:協助工程師與領域專家合作,快速啟動針對特定領域的資料集建立資源。
- DPO/ORPO 資料集:提供在不同語言、領域與任務下構建 Direct Preference Optimization(DPO)風格資料集的指引。
- KTO 資料集:提供工具與說明,協助社群建立 Kahneman‑Tversky Optimization(KTO)資料集。
主要洞見與經驗教訓
透過 DIBT 倡議,Hugging Face 與 Argilla 發現了關於開源資料協作的多項關鍵結論:
- 社群需求:社群對於參與集體資料集建構展現出高度熱情與強烈意願。
- 資料不平等:現存的不平等仍然存在,導致某些語言、領域與任務在開源基準中仍被低估,需採取更具包容性的方式以確保全面評估。
- 工具可用性:有效的社群協作建構資料集所需的工具已經存在,可用於擴大社群規模的協作。
如何貢獻
對 DIBT 倡議的貢獻持續進行中。使用者可依照 README 中特定 cookbook 專案的說明參與,分享自己的資料集與成果,或貢獻新的指南與工具。此等協作的協調於 Hugging Face Discord 伺服器的 #data-is-better-together 頻道進行。