databrickslabs/dbldatagen
Generate relevant synthetic data quickly for your projects. The Databricks Labs synthetic data generator (aka `dbldatagen`) may be used to generate large simulated / synthetic data sets for test, POCs, and other uses in Databricks environments including in Delta Live Tables pipelines
何を解決するか
Databricks環境内で、最大数十億行に及ぶ大量の合成データを生成する方法を提供します。これは、本番データを必要とせずにテスト、ベンチマーク、デモ作成に不可欠です。
動作方法
このライブラリは、Pythonコードで定義された仕様に基づいてSparkを使用してデータを生成します。ユーザーは事前定義された標準データセットを使用するか、列の型、値の範囲、分布、フィールド間の関係を定義するカスタム仕様を作成できます。Databricks Delta Live Tablesに直接統合され、Fakerなどのサードパーティライブラリ用のプラグインメカニズムもサポートしています。
対象ユーザー
Databricksエコシステム内で作業するデータエンジニアや開発者で、パイプラインやML特徴量配列にスケーラブルで繰り返し可能かつ一貫性のある合成データが必要な方々です。
特徴
- 大規模スケール: Sparkクラスタを使用して数分で数十億行のデータを生成可能。
- 繰り返し可能な一貫性: 複雑な結合やマージシナリオに対応する一貫性のあるプライマリキーおよび外部キーをサポート。
- 柔軟な生成: Spark SQLのすべてのプリミティブ型、カスタム分布、SQL式をサポート。
- スキーマ駆動: 既存のスキーマに準拠したデータ生成または即時作成が可能。
- ML対応: MLスタイルの特徴量配列に特化した値の配列を生成可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト