mostly-ai/mostlyai
Synthetic Data SDK ✨
What it solves
プライバシーを保護しながら、分析やテストに必要な高忠実度データへのアクセスという課題を解決します。ユーザーはタブularまたは言語データセットの合成バージョンを作成でき、元データの統計的特性を保持しつつ機密情報を露出させません。
How it works
SDK は既存のデータ資産上で「Generators」をトレーニングするためのプログラムインターフェースを提供します。これらのジェネレータは、タブular データ用の TabularARGN、グラフ関係用の DNN、テキスト用のファインチューニングされた Hugging Face モデルや LSTM など、さまざまなモデルを使用してデータの基礎パターンを学習します。トレーニングが完了すると、これらのジェネレータを使って合成データセットを生成したり、特定の代表サンプルを抽出したり、固定列値に基づく条件シミュレーションを実行したりできます。
Who it’s for
機械学習、ソフトウェアテスト、データ共有のためにプライバシー安全なデータセットが必要なデータサイエンティストや開発者向けです。また、これらのプロセスをローカルコンピュートでもリモートエンドポイントでも柔軟に実行したい方に適しています。
Highlights
- Broad Data Support: カテゴリカル、数値、ジオスペーシャル、テキストなどの混合型データ、マルチテーブル構造、時系列データを扱えます。
- Flexible Deployment: ローカル(LOCAL)モードでオンプレミス計算、クライアント(CLIENT)モードでリモートエンドポイントを提供します。
- Advanced Synthesis: アップサンプリング、条件シミュレーション、過小表現セグメントのリバランス、統計的公平性コントロールをサポートします。
- Quality Assurance: 保真度とプライバシーの自動品質指標を含み、詳細な HTML レポートで視覚的分析が可能です。
- Integration: Snowflake、Postgres、BigQuery など、さまざまなデータベースやクラウドストレージ向けの組み込みコネクタを提供します。