sdv-dev/SDGym

Benchmarking synthetic data generation methods.

What it solves

標準化された方法で、異なる合成データ生成手法を比較できるようにします。モデルを手動でテストする代わりに、古典的統計からディープラーニングまで、さまざまなモデリングアプローチのパフォーマンス、メモリ使用量、データ品質をベンチマークし、特定のデータに最も効果的な手法を判断できます。

How it works

SDGym は Synthetic Data Vault(SDV)エコシステムと統合されたベンチマークフレームワークです。ユーザーは SDV ライブラリ、組み込みベースライン、またはカスタム機械学習モデルから合成器(synthesizer)を選択し、公開データセットまたはプライベートデータセットに対して実行できます。フレームワークはパフォーマンス、メモリ消費、品質/プライバシー指標に基づいてこれらのモデルを評価します。

Who it’s for

高品質な合成データを生成し、さまざまな生成モデルを客観的に比較して、効率と精度のベストバランスを見つけたいデータサイエンティストや ML エンジニア向けです。

Highlights

  • Flexible Synthesizer Support: SDV の synthesizer、基本ベースライン、ユーザー定義のトレーニング・サンプリングロジックに対応。
  • Dataset Integration: 公開データセットのライブラリを含み、ローカルまたは Amazon S3 バケットに保存されたカスタムデータもサポート。
  • Comprehensive Metrics: 出力品質とプライバシーだけでなく、パフォーマンスとメモリ使用量という計算コストも測定。
  • SDV Ecosystem: Synthetic Data Vault プロジェクト全体とシームレスに統合され、データ生成と評価が容易に行えます。