mostly-ai/mostlyai

Synthetic Data SDK ✨

何を解決するか

分析や開発に必要な高精度なデータへのアクセスを維持しつつプライバシーを守る課題に対処します。ユーザーが元のデータの統計的特性を保持しつつ、機密情報を露出せずに、表形式または言語データセットの合成バージョンを作成できるようにします。

動作方法

SDKは、既存のデータ資産上で「ジェネレータ」をトレーニングするためのプログラムインターフェースを提供します。これらのジェネレータは、TabularARGN(表形式データ用)、DNN(グラフ関係用)、Hugging Faceモデルのファインチューニング版またはLSTM(テキスト用)などのさまざまなモデルを使用して、データの背後にあるパターンを学習します。トレーニングが完了すると、これらのジェネレータは合成データセットの作成、特定の代表的なサンプルの調査、または固定された列値に基づく条件付きシミュレーションに使用できます。

対象ユーザー

テスト、機械学習モデルのトレーニング、または組織間でのデータ共有を行う際にプライバシーを守る必要があるデータサイエンティストや開発者向けに設計されています。

主な特徴

  • 広範なデータ対応: カテゴリカル、数値、地理空間、テキストなどの混合型データ、複数テーブル構造、時系列データに対応。
  • 柔軟なデプロイメント: オンプレミス計算用の LOCAL モードと、リモートエンドポイント用の CLIENT モードを提供。
  • 高度なサンプリング: オーバーサンプリング、条件付きシミュレーション、未代表化されたセグメントの再バランス、統計的公平性制御をサポート。
  • 品質保証: 精度とプライバシーのための自動化された品質メトリクスを備え、視覚分析用の詳細な HTML レポートを提供。
  • 豊富な統合: BigQuery、Snowflake、PostgreSQL、MySQL、Oracle などのさまざまなデータソースと接続可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト