SyGra:低程式碼框架,用於 LLM 與 SLM 資料生成

SyGra 是一個低程式碼/無程式碼框架,旨在簡化大型語言模型(LLM)與小型語言模型(SLM)資料集的建立、轉換與對齊。透過將焦點從撰寫複雜的工程腳本轉移到提示工程,SyGra 讓團隊能快速產生高品質、領域特定的資料,以供模型訓練與對齊使用。

核心功能與解決的資料挑戰

SyGra 透過提供彈性的工作流程,解決資料準備管線中常見的瓶頸,支援多種複雜情境:

  • 資料集轉換與增強:將現有知識庫轉換為問答格式,將簡單資料集轉換為複雜推理任務,並將淺層問題擴展為深入的、多回合或重推理的查詢。
  • 模型對齊資料:從監督式微調(SFT)資料集中產生 Direct Preference Optimization(DPO)所需的偏好對。
  • 領域特定策展:過濾與策展大量語料庫以進行領域特定的中期訓練,並透過品質過濾自動移除低品質樣本。
  • 多模態與跨語言處理:將 PDF 與影像轉換為結構化文件以供問答系統使用,並將資料集翻譯或調整至不同語言(例如德文轉英文)。
  • 情境最佳化:將小片段情境擴展為適用於 Retrieval-Augmented Generation(RAG)管線的大情境資料集。
  • 推理增強:促使模型產生更佳的「思考 token」,提升逐步解題的能力。

技術架構與整合

SyGra 同時以 Python 函式庫與完整框架的形式實作,得以直接整合至現有的機器學習工作流程中。

主要技術特性

  • 推論後端支援:框架可無縫搭配多種推論後端,包括 vLLM、Hugging Face TGI、Triton 與 Ollama。
  • 低程式碼介面:透過即插即用的資料集建立方式,降低大量工程開發的需求。
  • 彈性生成:系統設計能因應各種使用情境,從簡易問答生成到複雜的 DPO 與多語言任務皆可支援。

對模型開發的影響

透過自動化資料策展與轉換的繁重工作,SyGra 旨在減少人工投入並加速 AI 模型的開發週期。此框架為開發團隊帶來四大主要好處:

  1. 加速對齊:更快速地為 SFT、DPO 與 RAG 管線準備資料。
  2. 工程效率:透過即插即用工作流程,減少撰寫自訂腳本的時間。
  3. 提升韌性:透過更佳的資料多樣性與結構,提升模型在領域特定與複雜任務上的表現。
  4. 減少人工策展:降低手動資料清理與標記的負擔。

Sources