Hugging Face 合成資料產生器

Hugging Face 已推出 合成資料產生器,一個無需編碼的應用程式,旨在讓使用者透過自然語言提示使用大型語言模型(LLMs)建立自訂資料集。此工具簡化了生成模擬真實世界資料的人工資訊的過程,使用者可透過擴充或增強現有資料集來克服資料限制,無需編寫程式碼。

核心功能與管道

合成資料產生器透過合成資料管道將使用者的自訂提示轉換為可用的資料集。此過程由 distilabel 框架和免費的 Hugging Face 文字生成 API 提供動力。

支援的資料集任務

該工具目前支援兩種主要的資料生成類型:

  • Text Classification: 此過程包含兩個由 LLM 驅動的步驟:生成多樣化的文字,然後為這些文字分配標籤。例如,argilla/synthetic-text-classification-news 資料集將合成新聞文章分為八個類別。
  • Chat Datasets: 這些資料集用於監督微調(SFT),允許 LLMs 透過聊天介面進行互動。例如,argilla/synthetic-sft-customer-support-single-turn 資料集專為客戶支援場景設計。

使用免費的 Hugging Face API,該工具通常每分鐘可為文字分類生成約 50 個樣本,為聊天資料集生成約 20 個樣本。

三步驟生成流程

該應用程式引導使用者經過精簡的工作流程,從提示進入完成的資料集:

  1. Describe Your Dataset: 使用者提供目標的詳細描述以及他們想要的助理類型,包括範例使用案例。
  2. Configure and Refine: 該工具根據描述生成樣本資料集。使用者接著可以調整系統提示和任務特定設定,透過儲存並重新生成樣本進行迭代,直至結果令人滿意。
  3. Generate and Push: 使用者定義資料集名稱、組織、要生成的樣本數量以及「temperature」(控制生成創意度)。最終輸出將直接儲存至 Argilla 和 Hugging Face Hub。

審閱、策劃與模型訓練

為確保資料品質,產生器直接與 Argilla 整合,這是一個供 AI 工程師和領域專家協作的工具。此整合允許使用者透過語義搜尋和可組合過濾器來探索和評估合成資料集。經過策劃後,資料集可匯出回 Hugging Face Hub 以進行模型訓練。

在訓練階段,Hugging Face 建議使用 AutoTrain,一個無需編碼的 AI 模型建立工具。使用者可以選擇任務(例如:文字分類),提供資料集來源,並在 Hugging Face CPU 硬體上訓練模型。

進階自訂與部署

對於技術使用者,合成資料產生器提供數種進階選項以擴充和自訂管道:

效能與準確度調整

透過將工具複製為私人 Space 並修改環境變數,使用者可以:

  • Change Models: 從預設的 meta-llama/Llama-3.1-8B-Instruct 切換到其他模型,例如 meta-llama/Llama-3.1-70B-Instruct 或 OpenAI 模型(例如透過將 BASE_URL 設為 https://api.openai.com/v1/ 來使用 gpt-4o)。
  • Increase Throughput: 調整 BATCH_SIZE(預設為 5)為更高的值,以提高每分鐘生成的樣本數量,視 API 提供者限制而定。
  • Private Integration: 透過設定 ARGILLA_URLARGILLA_API_KEY 連接到私人 Argilla 實例。

本地部署與開放原始碼

該工具採用 Apache 2 授權發布,並在 GitHub 上提供。可透過 pip install synthetic-dataset-generator 安裝為 Python 套件,以進行本地修改與適應。

未來路線圖

Hugging Face 正積極致力於為 合成資料產生器 添加新功能,包括:

  • 檢索增強生成(RAG)支援。
  • 使用「LLMs 作為評判者」進行自訂評估。

Sources