SyGra 2.0.0 Studio リリース

SyGra 2.0.0 は Studio を導入します。これは、合成データ生成を YAML ファイルの手動編集やターミナル操作というプロセスから、透明で視覚的なクラフトへと変換するインタラクティブなビジュアル環境です。Studio はキャンバス上でフローを構成し、データセットをプレビューし、インライン変数ヒントでプロンプトを調整できるだけでなく、対応するグラフ構成とタスク実行スクリプトを生成することで、基盤となる SyGra プラットフォームとの完全な互換性を保ちます。

ビジュアルワークフローデザインと構成

SyGra Studio はドラッグ&ドロップインターフェースを通じて合成データパイプラインの作成を可能にします。ユーザーはさまざまなノードタイプと設定オプションを利用して複雑なロジックを構築できます。

  • LLM Nodes: ユーザーは設定済みモデル(例: gpt-4o-mini)を選択し、プロンプトを書き、出力変数を定義できます(例: 結果を story_body に保存)。
  • Advanced Logic: 環境は構造化出力、ツール添付、Lambda ノード、再利用可能なロジックや分岐動作のための Subgraph ノードをサポートします。
  • Dynamic Prompting: プロンプトエディタ内で { を入力すると、利用可能なすべての状態変数が即座に表示され、前のノードからのデータをシームレスに参照できます。
  • Multi-LLM Settings: 詳細パネルでモデルパラメータや並列生成の設定にアクセスできます。

データソース統合と検証

Studio はデータソース構成と検証のためのガイド付きフォームを提供し、合成データ生成の初期段階を簡素化します。

  • Supported Connectors: ユーザーは Hugging Face、ローカルファイルシステム、または ServiceNow データソースに接続できます。
  • Immediate Preview: repo_id、split、ファイルパスなどのパラメータを入力した後、サンプル行をプレビューしてデータが正しいことを実行前に確認できます。
  • Automatic Variable Mapping: データソースの列名は自動的に状態変数(例: {prompt}, {genre})に変換され、手動での配線や推測が不要になります。

実行、可観測性、デバッグ

SyGra Studio はリアルタイムのモニタリングとデバッグツールを提供し、合成データ実行の品質とコストを保証します。

  • Real-time Streaming: Execution パネルはワークフロー実行中にノードステータス、トークン使用量、レイテンシ、コストをリアルタイムでストリーミングします。
  • Observability: 詳細なログと実行履歴は .executions/runs/*.json に保存され、過去の実行結果と比較できます。
  • Debugging Tools: インターフェースにはインラインログ、ブレークポイント、Monaco バックエンドのコードエディタが組み込まれ、迅速な反復が可能です。
  • Run Configuration: Run モーダルでバッチサイズ、レコード数、リトライ動作、温度設定を調整でき、基盤の YAML 設定を変更する必要がありません。

モデルサポートと統合

Studio は幅広いモデルプロバイダーとカスタムエンドポイントをサポートし、生成の柔軟性を確保します。

  • Guided Configuration: ユーザーは OpenAI、Azure OpenAI、Ollama、Vertex、Bedrock、vLLM、カスタムエンドポイントのモデルを検証できます。
  • Infrastructure Compatibility: Studio が tasks/examples/ に書き込む YAML/JSON アーティファクトは CLI と同一であるため、ビジュアルデザインは同じ実行エンジンと完全に互換性があります。

使用例: Glaive Code Assistant

SyGra Studio は既存のワークフロー、例えば Glaive Code Assistant を実行できます。この特定のワークフローは glaiveai/glaive-code-assistant-v2 データセットを取り込み、2 つの LLM ノード(generate_answercritique_answer)を条件付きエッジで結んだループを使用します。批評ノードが "NO MORE FEEDBACK" を返すまでループを続け、最終的にモデルのトレーニングや評価に使用できる合成データが生成されます。

Sources