mostly-ai/mostlyai
Synthetic Data SDK ✨
해결하는 문제
분석 및 개발을 위한 고정밀 데이터 접근을 유지하면서도 개인정보를 보호하는 문제를 해결합니다. 사용자는 원본 데이터의 통계적 특성을 유지하면서도 민감 정보를 노출하지 않고 표 형식 또는 언어 데이터셋의 합성 버전을 생성할 수 있습니다.
작동 방식
SDK는 기존 데이터 자산 위에서 "생성기"를 훈련하기 위한 프로그래밍 인터페이스를 제공합니다. 이러한 생성기는 표 형식 데이터용 TabularARGN, 그래프 관계용 DNN, 텍스트용 Hugging Face 모델의 파인튜닝 버전 또는 LSTMs 등의 다양한 모델을 사용하여 데이터의 기본 패턴을 학습합니다. 훈련이 완료되면 이러한 생성기는 합성 데이터셋 생성, 특정 대표 샘플 탐색, 또는 고정된 열 값 기반의 조건부 시뮬레이션에 사용할 수 있습니다.
대상 사용자
테스트, 머신러닝 모델 훈련, 또는 조직 간 데이터 공유 시 보안을 해치지 않으면서도 개인정보 보호가 필요한 데이터 과학자 및 개발자에게 적합합니다.
주요 특징
- 다양한 데이터 지원: 범주형, 수치형, 지리공간, 텍스트 데이터를 포함한 혼합형 데이터, 다중 테이블 구조, 시계열 데이터를 처리합니다.
- 유연한 배포: 온프레미스 컴퓨팅을 위한 LOCAL 모드와 원격 엔드포인트를 위한 CLIENT 모드를 제공합니다.
- 고급 샘플링: 오버샘플링, 조건부 시뮬레이션, 대표성 부족 세그먼트의 재균형화, 통계적 공정성 제어를 지원합니다.
- 품질 보증: 정밀도 및 개인정보 보호를 위한 자동화된 품질 메트릭을 포함하며, 시각적 분석을 위한 상세한 HTML 리포트를 제공합니다.
- 풍부한 통합: BigQuery, Snowflake, PostgreSQL, MySQL, Oracle 등의 다양한 데이터 소스와 연결 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트