NVIDIA-NeMo/DataDesigner

🎨 NeMo Data Designer: Generate high-quality synthetic data from scratch or from seed data.

解決する課題

基本的なLLMプロンプティングを超え、検証とスコアリングを通じてデータの多様性、統計的正確性、および高品質を確保することで、プロダクショングレードの合成データセットの作成を簡素化します。

仕組み

Data Designerは、ユーザーが統計サンプラー、LLMベースの生成、またはシードデータを使用して列を定義できる柔軟なフレームワークを使用します。フィールド間の関係を維持するための依存関係を考慮した生成をサポートし、独立した列をオーバーラップさせることでパフォーマンスを最適化する非同期エンジンを採用しています。システムには、組み込みのバリデーター(Python、SQL、およびリモート)と、出力が品質基準を満たしているかを確認するためのLLM-as-a-judgeスコアリングが含まれています。

対象者

AIモデルのトレーニングやテストのために高品質で構造化された合成データを必要とする開発者や研究者、およびデータセットのスキーマ設計と生成を自動化するためにコーディングエージェントを使用している方々。

ハイライト

  • 多様な生成方法: 統計サンプラー、LLM、およびシードデータを組み合わせます。
  • 依存関係を考慮した生成: さまざまなデータフィールド間の関係を制御します。
  • 品質保証: Python、SQL、およびカスタムバリデーターとLLM-as-a-judgeスコアリングを統合。
  • パフォーマンスの最適化: パイプライン実行を高速化するセルレベルの非同期エンジン。
  • エージェント統合: 設計と生成プロセスを自動化するためのコーディングエージェント向けスキルが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト