InternScience/GraphGen

GraphGen: Enhancing Supervised Fine-Tuning for LLMs with Knowledge-Driven Synthetic Data Generation

解決する課題

GraphGenは、高品質で知識駆動型の合成データを生成することにより、大規模言語モデル(LLM)の監督付きファインチューニング(SFT)を改善するために設計されたフレームワークです。特に、高価値でロングテールな知識のQAペアの生成を優先することで、LLMにおける「知識ギャップ」、つまりモデルが情報を欠いているかキャリブレーションが不十分な領域の問題に特化して取り組みます。

仕組み

GraphGenは、構造化されたパイプラインに従って合成トレーニングデータを作成します:

  1. 知識グラフの構築:ソーステキスト(PDF、JSON、TXTなど)または外部データベース(UniProt、NCBI、Wikipedia)から細粒度の知識グラフを構築します。
  2. ギャップの特定:期待キャリブレーション誤差指標を使用して、LLMが知識を欠いている箇所を特定します。
  3. ターゲットを絞った生成:知識グラフに基づいてQAペアを生成し、複雑な関係を捉えるためにマルチホップ近傍サンプリングを使用し、多様性のためにスタイル制御生成を行います。
  4. データ拡張:LLM駆動の言い換えを使用して、同じコーパスの多様なバリアントを作成するリフレーズパイプラインを含み、事前学習中の冗長性を回避します。

対象者

このツールは、LLMのために高品質なトレーニングデータを合成する必要があるAI研究者や開発者、特に医学、法律、生物学(例:植物科学)などの知識集約型ドメインで作業する人を対象としています。

ハイライト

  • 多様なデータタイプ:Atomic、Aggregated、Chain-of-Thought (CoT)、Multi-hop、VQA(視覚的質問応答)、およびベンチマークスタイルのデータ(多肢選択、穴埋め、正誤)の生成をサポートしています。
  • 広範な統合性:さまざまな推論バックエンド(vLLM、SGLang、HuggingFace)およびAPIサーバー(OpenAI、Azure、Ollama)と互換性があります。
  • 柔軟なデータソース:ファイル、検索エンジン(Google、Bing)、および専門的なバイオインフォマティクスデータベースからデータを取り込むことができます。
  • スケーラブルなアーキテクチャ:分散実行にRayを利用し、効率的なストレージのためにKuzuDBとRocksDBをサポートしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト