Argilla 2.4 版本說明 / 新功能
Argilla 2.4 讓使用者無需編寫程式碼即可準備 AI 資料集,透過直接將 Hugging Face Hub 的資料集匯入 Argilla 的 UI。此更新簡化了收集人類回饋以進行微調與評估的流程,讓不熟悉 Python 的領域專家也能民主化地建立資料集。
無程式碼資料集準備於 Hugging Face Hub
Argilla 2.4 允許使用者匯入 Hugging Face Hub 上的任何公開資料集(目前已超過 230,000 個資料集),作為 AI 專案的基礎。透過 Argilla UI,開發者與領域專家可以定義問題並收集人類回饋,無需使用 Python SDK。
此功能旨在支援多種關鍵使用情境:
- 社群貢獻: 使用者可以將開放資料集匯入公開的 Argilla Space,並分享 URL 以收集更廣大社群的回饋。
- 新資料集建立: 使用者可以將 CSV 上傳至 Hub,然後匯入 Argilla Space,從頭開始標記。
- 資料集策展: 可將現有的 Hub 資料集匯入 Argilla Spaces,專門用於模型微調或評估的策展。
- 資料集改進: 使用者可以匯入現有的 Hub 資料集,提供回饋並加以改進,以惠及社群。
技術工作流程與實作
要使用這些功能,使用者必須先部署 Argilla,建議的方式是在 Hugging Face Spaces 上部署。預設部署包含 Hugging Face OAuth,若 Space 為公開,任何 Hub 使用者皆可貢獻標註。
匯入流程如下:
- 資料集選擇: 使用者登入後,在首頁使用「Import dataset from Hugging Face」按鈕,提供資料庫 ID 或選擇範例資料集。
- 設定: Argilla 會根據資料集的特徵自動建議初始設定。使用者可新增問題(例如標籤、評分、排名或文字),或移除不必要的欄位(例如文字、聊天或影像)。
- 資料集建立: 當設定完成且變更即時顯示後,使用者點擊「Create dataset」以完成匯入。
在此功能的第一個版本中,Hub 資料集必須為公開。對私有資料集的支援目前是未來開發的需求。
與 Hugging Face 生態系統的整合
雖然無程式碼 UI 簡化了匯入流程,Argilla Python SDK 仍提供給需要進階客製化的使用者。Argilla 是一套開源、以資料為中心的工具,與 Hugging Face Hub 整合,旨在促進 AI 開發者與領域專家之間的協作,打造高品質資料集。