databrickslabs/dbldatagen

Generate relevant synthetic data quickly for your projects. The Databricks Labs synthetic data generator (aka `dbldatagen`) may be used to generate large simulated / synthetic data sets for test, POCs, and other uses in Databricks environments including in Delta Live Tables pipelines

何を解決するか

Databricks環境内で、最大数十億行に及ぶ大量の合成データを生成する方法を提供します。これは、本番データを必要とせずにテスト、ベンチマーク、デモ作成に不可欠です。

動作方法

このライブラリは、Pythonコードで定義された仕様に基づいてSparkを使用してデータを生成します。ユーザーは事前定義された標準データセットを使用するか、列の型、値の範囲、分布、フィールド間の関係を定義するカスタム仕様を作成できます。Databricks Delta Live Tablesに直接統合され、Fakerなどのサードパーティライブラリ用のプラグインメカニズムもサポートしています。

対象ユーザー

Databricksエコシステム内で作業するデータエンジニアや開発者で、パイプラインやML特徴量配列にスケーラブルで繰り返し可能かつ一貫性のある合成データが必要な方々です。

特徴

  • 大規模スケール: Sparkクラスタを使用して数分で数十億行のデータを生成可能。
  • 繰り返し可能な一貫性: 複雑な結合やマージシナリオに対応する一貫性のあるプライマリキーおよび外部キーをサポート。
  • 柔軟な生成: Spark SQLのすべてのプリミティブ型、カスタム分布、SQL式をサポート。
  • スキーマ駆動: 既存のスキーマに準拠したデータ生成または即時作成が可能。
  • ML対応: MLスタイルの特徴量配列に特化した値の配列を生成可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト