mostly-ai/mostlyai

Synthetic Data SDK ✨

What it solves

プライバシーを保護しながら、分析やテストに必要な高忠実度データへのアクセスという課題を解決します。ユーザーはタブularまたは言語データセットの合成バージョンを作成でき、元データの統計的特性を保持しつつ機密情報を露出させません。

How it works

SDK は既存のデータ資産上で「Generators」をトレーニングするためのプログラムインターフェースを提供します。これらのジェネレータは、タブular データ用の TabularARGN、グラフ関係用の DNN、テキスト用のファインチューニングされた Hugging Face モデルや LSTM など、さまざまなモデルを使用してデータの基礎パターンを学習します。トレーニングが完了すると、これらのジェネレータを使って合成データセットを生成したり、特定の代表サンプルを抽出したり、固定列値に基づく条件シミュレーションを実行したりできます。

Who it’s for

機械学習、ソフトウェアテスト、データ共有のためにプライバシー安全なデータセットが必要なデータサイエンティストや開発者向けです。また、これらのプロセスをローカルコンピュートでもリモートエンドポイントでも柔軟に実行したい方に適しています。

Highlights

  • Broad Data Support: カテゴリカル、数値、ジオスペーシャル、テキストなどの混合型データ、マルチテーブル構造、時系列データを扱えます。
  • Flexible Deployment: ローカル(LOCAL)モードでオンプレミス計算、クライアント(CLIENT)モードでリモートエンドポイントを提供します。
  • Advanced Synthesis: アップサンプリング、条件シミュレーション、過小表現セグメントのリバランス、統計的公平性コントロールをサポートします。
  • Quality Assurance: 保真度とプライバシーの自動品質指標を含み、詳細な HTML レポートで視覚的分析が可能です。
  • Integration: Snowflake、Postgres、BigQuery など、さまざまなデータベースやクラウドストレージ向けの組み込みコネクタを提供します。