SyGra 2.0.0 Studio 發佈
SyGra 2.0.0 引入了 Studio,這是一個互動式視覺化環境,旨在將合成數據生成從手動編輯 YAML 檔案和使用終端機的過程,轉變為透明且視覺化的工藝。Studio 允許使用者在畫布上組合流程、預覽數據集,並透過內聯變數提示來調整提示詞(prompts),同時透過生成相應的圖形配置和任務執行器腳本,保持與底層 SyGra 平台完全相容。
視覺化工作流設計與組合
SyGra Studio 可透過拖放介面建立合成數據管線。使用者可以利用各種節點類型和配置選項來構建複雜邏輯:
- LLM 節點: 使用者可以選擇已配置的模型(例如
gpt-4o-mini),編寫提示詞,並定義輸出變數(例如,將結果儲存在story_body中)。 - 進階邏輯: 該環境支援結構化輸出、工具附件、Lambda 節點以及用於可重複使用邏輯或分支行為的 Subgraph 節點。
- 動態提示詞: 在提示詞編輯器中輸入
{會立即顯示所有可用的狀態變數,從而實現對先前節點數據的無縫引用。 - 多 LLM 設定: 詳細資訊面板提供了存取模型參數和並行生成設定的權限。
數據源整合與驗證
Studio 透過提供引導式表單來進行數據源配置和驗證,簡化了合成數據生成的初始階段:
- 支援的連接器: 使用者可以連接到 Hugging Face、本地檔案系統或 ServiceNow 數據源。
- 立即預覽: 在輸入
repo_id、分割比例或檔案路徑等參數後,使用者可以預覽樣本列,以確保在執行前數據是正確的。 - 自動變數映射: 來自數據源的欄位名稱會自動轉換為狀態變數(例如
{prompt}、{genre}),消除了手動連接和猜測。
執行、可觀測性與除錯
SyGra Studio 提供即時監控和除錯工具,以確保合成數據運行的品質和成本:
- 即時串流: 在工作流運行期間,執行面板會即時串流節點狀態、Token 使用量、延遲和成本。
- 可觀測性: 詳細的日誌和執行歷史會儲存在
.executions/runs/*.json中,允許使用者將結果與先前的執行進行比較。 - 除錯工具: 介面包含內聯日誌、斷點和基於 Monaco 的程式碼編輯器,以便快速迭代。
- 運行配置: 運行模態視窗允許使用者在不修改底層 YAML 配置的情況下,調整批次大小、記錄數量、重試行為和溫度(temperatures)。
模型支援與整合
Studio 支援廣泛的模型提供商和自定義端點,以確保生成的靈活性:
- 引導式配置: 使用者可以驗證 OpenAI、Azure OpenAI、Ollama、Vertex、Bedrock、vLLM 以及自定義端點的模型。
- 基礎設施相容性: 由於 Studio 生成的與寫入
tasks/examples/的 YAML/JSON 產物物完全相同,因此視覺化設計與 CLI 的執行引擎完全相容。
使用案例範例:Glaive Code Assistant
SyGra Studio 可以執行現有的工作流,例如 Glaive Code Assistant。這個特定的工作流會攝取 glaiveai/glaive-code-assistant-v2 數據集,並採用兩個 LLM 節點(generate_answer 和 critique_answer)組成的迴圈,並由條件邊(conditional edge)連接。該過程會持續迴圈,直到評估節點返回
Sources
- OriginalIntroducing SyGra Studio
相關
- Dispatch
- Dispatch
- 專案
- Dispatch
- 專案