databrickslabs/dbldatagen

Generate relevant synthetic data quickly for your projects. The Databricks Labs synthetic data generator (aka `dbldatagen`) may be used to generate large simulated / synthetic data sets for test, POCs, and other uses in Databricks environments including in Delta Live Tables pipelines

解決的問題

提供在 Databricks 環境中生成大量合成資料(最多可達數十億列)的方法。這對於無需真實生產資料即可進行測試、基準測試和示範至關重要。

運作方式

該程式庫使用 Spark 根據 Python 程式碼中定義的規格生成資料。使用者可使用預先定義的標準資料集,或建立自訂規格,定義欄位類型、數值範圍、分佈以及欄位間的關聯性。它可直接整合至 Databricks Delta Live Tables,並支援第三方程式庫(如 Faker)的外掛機制。

適用對象

需要在 Databricks 生態系統中建立可擴展、可重複且一致的合成資料,以用於資料流程與機器學習特徵陣列的資料工程師與開發人員。

主要亮點

  • 大規模擴展:使用 Spark 集群可在數分鐘內生成數十億列資料。
  • 可重複的一致性:支援在複雜的關聯與合併情境中保持一致的主鍵與外鍵。
  • 彈性生成:支援所有 Spark SQL 原始類型、自訂分佈與 SQL 表達式。
  • 模式驅動:可生成符合既有模式的資料,或即時建立模式。
  • 機器學習就緒:可生成專為機器學習風格特徵陣列設計的值陣列。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案