mostly-ai/mostlyai
Synthetic Data SDK ✨
What it solves
프라이버시를 유지하면서 분석 및 테스트에 필요한 고충실도 데이터를 접근하는 문제를 해결합니다. 사용자는 원본 데이터의 통계적 특성을 보존하면서 민감 정보를 노출하지 않는 표형 또는 언어 데이터셋의 합성 버전을 만들 수 있습니다.
How it works
SDK는 기존 데이터 자산에 대해 "Generators"를 훈련시키는 프로그래밍 인터페이스를 제공합니다. 이러한 생성기는 TabularARGN(표형 데이터용), DNN(그래프 관계용), 파인튜닝된 Hugging Face 모델 또는 LSTM(텍스트용) 등 다양한 모델을 사용해 데이터의 기본 패턴을 학습합니다. 훈련이 완료되면, 이 생성기를 사용해 합성 데이터셋을 생성하거나, 특정 대표 샘플을 추출하거나, 고정된 컬럼 값을 기반으로 조건 시뮬레이션을 수행할 수 있습니다.
Who it’s for
머신러닝, 소프트웨어 테스트, 데이터 공유를 위해 프라이버시 안전한 데이터셋이 필요한 데이터 과학자와 개발자를 위해 설계되었으며, 이러한 프로세스를 로컬 컴퓨팅 또는 원격 엔드포인트에서 유연하게 실행하고자 하는 사람들을 위한 것입니다.
Highlights
- Broad Data Support: 범주형, 수치형, 지리공간, 텍스트 등 혼합형 데이터와 다중 테이블 구조, 시계열 데이터를 처리합니다.
- Flexible Deployment: 로컬(LOCAL) 모드로 온프레미스 컴퓨팅을 제공하고, 클라이언트(CLIENT) 모드로 원격 엔드포인트를 지원합니다.
- Advanced Synthesis: 업샘플링, 조건 시뮬레이션, 소수 집단 재균형, 통계적 공정성 제어를 지원합니다.
- Quality Assurance: 충실도와 프라이버시를 측정하는 자동화된 품질 메트릭을 포함하며, 상세 HTML 보고서를 통해 시각적 분석이 가능합니다.
- Integration: Snowflake, Postgres, BigQuery 등 다양한 데이터베이스와 클라우드 스토리지를 위한 내장 커넥터를 제공합니다.