sdv-dev/SDGym
Benchmarking synthetic data generation methods.
What it solves
표준화된 방법을 제공하여 다양한 합성 데이터 생성 기술을 비교할 수 있게 합니다. 모델을 수동으로 테스트하는 대신, 고전 통계부터 딥러닝에 이르는 다양한 모델링 접근법에 대해 성능, 메모리 사용량 및 데이터 품질을 벤치마크하여 특정 데이터에 가장 효과적인 방법을 판단할 수 있습니다.
How it works
SDGym은 Synthetic Data Vault(SDV) 생태계와 통합된 벤치마크 프레임워크입니다. 사용자는 SDV 라이브러리, 내장 베이스라인 또는 사용자 정의 머신러닝 모델 중에서 synthesizer를 선택하고, 공개 데이터셋 또는 사설 데이터셋에 대해 실행할 수 있습니다. 프레임워크는 성능, 메모리 소비 및 품질/프라이버시 지표를 기반으로 이러한 모델을 평가합니다.
Who it’s for
고품질 합성 데이터를 생성하고, 다양한 생성 모델을 객관적으로 비교하여 효율성과 정확성의 최적 균형을 찾고자 하는 데이터 과학자 및 ML 엔지니어를 위한 것입니다.
Highlights
- Flexible Synthesizer Support: SDV synthesizer, 기본 베이스라인 및 사용자 정의 학습·샘플링 로직과 호환됩니다.
- Dataset Integration: 공개 데이터셋 라이브러리를 포함하고, 로컬 또는 Amazon S3 버킷에 저장된 사용자 정의 데이터도 지원합니다.
- Comprehensive Metrics: 출력 품질 및 프라이버시뿐만 아니라 성능과 메모리 사용량이라는 계산 비용도 측정합니다.
- SDV Ecosystem: Synthetic Data Vault 프로젝트와 완전히 통합되어 원활한 데이터 생성 및 평가가 가능합니다.