sapientml/sapientml
Generative AutoML for Tabular Data
何を解決するか
SapientMLは、自動機械学習(AutoML)における「探索空間の爆発」問題に対処します。従来のAutoMLツールは、大規模で複雑な表形式データセットを扱う場合、MLコンポーネントの組み合わせの可能性が多すぎて効率的に探索できないため、最適なパイプラインを見つけるのが困難または完全に失敗することがあります。
どうやって動くか
SapientMLは、Kaggleなどのソースから抽出された既存のデータセットと人間が書いたソリューション(コーパス)から学習することで、機械学習パイプラインを生成的に合成します。3段階の分割統治型プログラム合成戦略を採用しています:
- メタ学習:特定のタスクに適した妥当なMLコンポーネントのセットを予測します。
- パイプラインの最適化:パイプラインデータフローモデルを使用して、これらのコンポーネントを少数の実行可能な具体的なパイプラインに絞り込みます。
- 動的評価:残りのパイプラインを評価し、最もパフォーマンスの高いソリューションを選択します。
どんな人向けか
表形式データ(分類および回帰)の高品質な予測パイプラインを手動でワークフロー全体を設計せずに生成したいデータサイエンティストや開発者向けに設計されています。
特徴
- 生成型コード:一部のAutoMLツールがモデルオブジェクトのみを提供するのに対し、SapientMLは実際にパイプラインを構築するために使用されるPythonコードを生成でき、保存・再利用が可能です。
- 人間のインスピレーション:170のデータセットにわたる1,094の人の手によるパイプラインからなる大規模なコーパスから学習しています。
- 頑健性:他のAutoMLツールがパイプラインを生成できなくなるような大規模な実世界データセットにも対応するよう特別に設計されています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト