databrickslabs/dbldatagen

Generate relevant synthetic data quickly for your projects. The Databricks Labs synthetic data generator (aka `dbldatagen`) may be used to generate large simulated / synthetic data sets for test, POCs, and other uses in Databricks environments including in Delta Live Tables pipelines

解决的问题

在 Databricks 环境中生成大规模合成数据(最多可达数十亿行)的方法。这对于无需真实生产数据即可进行测试、基准测试和演示至关重要。

工作原理

该库使用 Spark 根据 Python 代码中定义的规范生成数据。用户可以使用预定义的标准数据集,也可以创建自定义规范,定义列类型、取值范围、分布以及字段之间的关系。它可直接集成到 Databricks Delta Live Tables 中,并支持第三方库(如 Faker)的插件机制。

适用人群

需要在 Databricks 生态系统中构建可扩展、可重复且一致的合成数据以用于数据管道和机器学习特征数组的数据工程师和开发人员。

主要亮点

  • 大规模生成:使用 Spark 集群可在数分钟内生成数十亿行数据。
  • 可重复的一致性:支持在复杂关联和合并场景中保持一致的主键和外键。
  • 灵活生成:支持所有 Spark SQL 原始类型、自定义分布和 SQL 表达式。
  • 基于模式:可生成符合现有模式的数据,也可即时创建模式。
  • 机器学习就绪:可生成专用于机器学习风格特征数组的值数组。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目