mostly-ai/mostlyai
Synthetic Data SDK ✨
何を解決するか
分析や開発に必要な高精度なデータへのアクセスを維持しつつプライバシーを守る課題に対処します。ユーザーが元のデータの統計的特性を保持しつつ、機密情報を露出せずに、表形式または言語データセットの合成バージョンを作成できるようにします。
動作方法
SDKは、既存のデータ資産上で「ジェネレータ」をトレーニングするためのプログラムインターフェースを提供します。これらのジェネレータは、TabularARGN(表形式データ用)、DNN(グラフ関係用)、Hugging Faceモデルのファインチューニング版またはLSTM(テキスト用)などのさまざまなモデルを使用して、データの背後にあるパターンを学習します。トレーニングが完了すると、これらのジェネレータは合成データセットの作成、特定の代表的なサンプルの調査、または固定された列値に基づく条件付きシミュレーションに使用できます。
対象ユーザー
テスト、機械学習モデルのトレーニング、または組織間でのデータ共有を行う際にプライバシーを守る必要があるデータサイエンティストや開発者向けに設計されています。
主な特徴
- 広範なデータ対応: カテゴリカル、数値、地理空間、テキストなどの混合型データ、複数テーブル構造、時系列データに対応。
- 柔軟なデプロイメント: オンプレミス計算用の LOCAL モードと、リモートエンドポイント用の CLIENT モードを提供。
- 高度なサンプリング: オーバーサンプリング、条件付きシミュレーション、未代表化されたセグメントの再バランス、統計的公平性制御をサポート。
- 品質保証: 精度とプライバシーのための自動化された品質メトリクスを備え、視覚分析用の詳細な HTML レポートを提供。
- 豊富な統合: BigQuery、Snowflake、PostgreSQL、MySQL、Oracle などのさまざまなデータソースと接続可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト