SyGra 2.0.0 Studio 發佈

SyGra 2.0.0 引入了 Studio,這是一個互動式視覺化環境,旨在將合成數據生成從手動編輯 YAML 檔案和使用終端機的過程,轉變為透明且視覺化的工藝。Studio 允許使用者在畫布上組合流程、預覽數據集,並透過內聯變數提示來調整提示詞(prompts),同時透過生成相應的圖形配置和任務執行器腳本,保持與底層 SyGra 平台完全相容。

視覺化工作流設計與組合

SyGra Studio 可透過拖放介面建立合成數據管線。使用者可以利用各種節點類型和配置選項來構建複雜邏輯:

  • LLM 節點: 使用者可以選擇已配置的模型(例如 gpt-4o-mini),編寫提示詞,並定義輸出變數(例如,將結果儲存在 story_body 中)。
  • 進階邏輯: 該環境支援結構化輸出、工具附件、Lambda 節點以及用於可重複使用邏輯或分支行為的 Subgraph 節點。
  • 動態提示詞: 在提示詞編輯器中輸入 { 會立即顯示所有可用的狀態變數,從而實現對先前節點數據的無縫引用。
  • 多 LLM 設定: 詳細資訊面板提供了存取模型參數和並行生成設定的權限。

數據源整合與驗證

Studio 透過提供引導式表單來進行數據源配置和驗證,簡化了合成數據生成的初始階段:

  • 支援的連接器: 使用者可以連接到 Hugging Face、本地檔案系統或 ServiceNow 數據源。
  • 立即預覽: 在輸入 repo_id、分割比例或檔案路徑等參數後,使用者可以預覽樣本列,以確保在執行前數據是正確的。
  • 自動變數映射: 來自數據源的欄位名稱會自動轉換為狀態變數(例如 {prompt}{genre}),消除了手動連接和猜測。

執行、可觀測性與除錯

SyGra Studio 提供即時監控和除錯工具,以確保合成數據運行的品質和成本:

  • 即時串流: 在工作流運行期間,執行面板會即時串流節點狀態、Token 使用量、延遲和成本。
  • 可觀測性: 詳細的日誌和執行歷史會儲存在 .executions/runs/*.json 中,允許使用者將結果與先前的執行進行比較。
  • 除錯工具: 介面包含內聯日誌、斷點和基於 Monaco 的程式碼編輯器,以便快速迭代。
  • 運行配置: 運行模態視窗允許使用者在不修改底層 YAML 配置的情況下,調整批次大小、記錄數量、重試行為和溫度(temperatures)。

模型支援與整合

Studio 支援廣泛的模型提供商和自定義端點,以確保生成的靈活性:

  • 引導式配置: 使用者可以驗證 OpenAI、Azure OpenAI、Ollama、Vertex、Bedrock、vLLM 以及自定義端點的模型。
  • 基礎設施相容性: 由於 Studio 生成的與寫入 tasks/examples/ 的 YAML/JSON 產物物完全相同,因此視覺化設計與 CLI 的執行引擎完全相容。

使用案例範例:Glaive Code Assistant

SyGra Studio 可以執行現有的工作流,例如 Glaive Code Assistant。這個特定的工作流會攝取 glaiveai/glaive-code-assistant-v2 數據集,並採用兩個 LLM 節點(generate_answercritique_answer)組成的迴圈,並由條件邊(conditional edge)連接。該過程會持續迴圈,直到評估節點返回

Sources

相關

  • Dispatch
  • Dispatch
  • 專案
  • Dispatch
  • 專案