databrickslabs/dbldatagen
Generate relevant synthetic data quickly for your projects. The Databricks Labs synthetic data generator (aka `dbldatagen`) may be used to generate large simulated / synthetic data sets for test, POCs, and other uses in Databricks environments including in Delta Live Tables pipelines
解決的問題
提供在 Databricks 環境中生成大量合成資料(最多可達數十億列)的方法。這對於無需真實生產資料即可進行測試、基準測試和示範至關重要。
運作方式
該程式庫使用 Spark 根據 Python 程式碼中定義的規格生成資料。使用者可使用預先定義的標準資料集,或建立自訂規格,定義欄位類型、數值範圍、分佈以及欄位間的關聯性。它可直接整合至 Databricks Delta Live Tables,並支援第三方程式庫(如 Faker)的外掛機制。
適用對象
需要在 Databricks 生態系統中建立可擴展、可重複且一致的合成資料,以用於資料流程與機器學習特徵陣列的資料工程師與開發人員。
主要亮點
- 大規模擴展:使用 Spark 集群可在數分鐘內生成數十億列資料。
- 可重複的一致性:支援在複雜的關聯與合併情境中保持一致的主鍵與外鍵。
- 彈性生成:支援所有 Spark SQL 原始類型、自訂分佈與 SQL 表達式。
- 模式驅動:可生成符合既有模式的資料,或即時建立模式。
- 機器學習就緒:可生成專為機器學習風格特徵陣列設計的值陣列。
相關
- 專案
- 專案
- 專案
- 專案
- 專案