databrickslabs/dbldatagen
Generate relevant synthetic data quickly for your projects. The Databricks Labs synthetic data generator (aka `dbldatagen`) may be used to generate large simulated / synthetic data sets for test, POCs, and other uses in Databricks environments including in Delta Live Tables pipelines
해결하는 문제
Databricks 환경 내에서 최대 수십억 행에 이르는 대량의 합성 데이터를 생성할 수 있는 방법을 제공합니다. 실제 생산 데이터 없이도 테스트, 벤치마킹, 데모를 수행하는 데 필수적입니다.
작동 방식
이 라이브러리는 Python 코드로 정의된 사양을 기반으로 Spark를 사용하여 데이터를 생성합니다. 사용자는 사전 정의된 표준 데이터셋을 사용하거나, 열의 타입, 값 범위, 분포, 필드 간 관계를 정의하는 사용자 정의 사양을 만들 수 있습니다. Databricks Delta Live Tables와 직접 통합되며, Faker와 같은 제3자 라이브러리용 플러그인 메커니즘도 지원합니다.
대상 사용자
Databricks 생태계 내에서 작업하는 데이터 엔지니어 및 개발자로, 파이프라인과 ML 특성 배열에 대해 확장 가능하고 반복 가능하며 일관된 합성 데이터가 필요한 분들입니다.
주요 특징
- 대규모 스케일: Spark 클러스터를 사용해 수분 내에 수십억 행의 데이터를 생성 가능.
- 반복 가능한 일관성: 복잡한 조인 및 병합 시나리오에 대응하는 일관된 기본키 및 외래키 지원.
- 유연한 생성: Spark SQL의 모든 기본 타입, 사용자 정의 분포, SQL 표현식 지원.
- 스키마 기반: 기존 스키마에 맞춰 데이터를 생성하거나 즉시 생성 가능.
- ML 준비: ML 스타일의 특성 배열에 특화된 값 배열 생성 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트