SyGra: LLM と SLM データ生成のためのローコードフレームワーク

SyGra は、Large Language Models(LLMs)と Small Language Models(SLMs)のデータセット作成、変換、アラインメントを効率化するために設計されたローコード/ノーコードフレームワークです。複雑なエンジニアリングスクリプトの記述からプロンプトエンジニアリングへのシフトにより、チームはモデルのトレーニングやアラインメントに必要な高品質でドメイン固有のデータを迅速に生成できます。

コア機能と解決されたデータ課題

SyGra は、データ準備パイプラインにおける一般的なボトルネックに対処し、いくつかの複雑なシナリオに対応する柔軟なワークフローを提供します。

  • データセット変換と拡張: 既存のナレッジベースを Q&A 形式に変換し、シンプルなデータセットを複雑な推論タスクに変換し、浅い質問を深いマルチターンや推論重視のクエリに拡張します。
  • モデルアラインメントデータ: Supervised Fine-Tuning (SFT) データセットから Direct Preference Optimization (DPO) に必要な嗜好ペアを生成します。
  • ドメイン固有のキュレーション: ドメイン固有の中間トレーニングのために大規模コーパスをフィルタリング・キュレーションし、品質フィルタリングにより低品質サンプルを自動的に除去します。
  • マルチモーダルおよびクロスランゲージ処理: PDF や画像を Q&A システム用の構造化ドキュメントに変換し、異なる言語間でデータセットを翻訳または適応させます(例: ドイツ語から英語)。
  • コンテキスト最適化: 小さなコンテキストチャンクを、Retrieval-Augmented Generation (RAG) パイプライン向けに最適化された大規模コンテキストデータセットに拡張します。
  • 推論強化: モデルをより良い「思考トークン」へと導き、ステップバイステップの問題解決能力を向上させます。

技術アーキテクチャと統合

SyGra は Python ライブラリと包括的フレームワークの両方として実装されており、既存の機械学習ワークフローに直接統合できます。

主要な技術機能

  • 推論バックエンドサポート: フレームワークは vLLM、Hugging Face TGI、Triton、Ollama など複数の推論バックエンドとシームレスに連携します。
  • ローコードインターフェース: データセット作成にプラグアンドプレイ方式を提供し、重いエンジニアリング作業の必要性を削減します。
  • 柔軟な生成: シンプルな Q&A 生成から複雑な DPO やマルチランゲージタスクまで、さまざまなユースケースに適応できるよう設計されています。

モデル開発へのインパクト

データキュレーションと変換の重労働を自動化することで、SyGra は手作業の負担を減らし、AI モデルの開発サイクルを加速することを目指します。フレームワークは開発チームに対し、主に以下の四つの利点を提供します:

  1. アラインメントの加速: SFT、DPO、RAG パイプライン向けデータの準備を迅速に行います。
  2. エンジニアリング効率: プラグアンドプレイワークフローにより、カスタムスクリプト作成に費やす時間を削減します。
  3. 堅牢性の向上: データの多様性と構造を改善することで、ドメイン固有や複雑なタスクにおけるモデル性能が向上します。
  4. 手動キュレーションの削減: 手作業によるデータクリーニングやラベリングの負担を軽減します。

Sources