upgini/upgini

Data search & enrichment library for Machine Learning → Easily find and add relevant features to your ML & AI pipeline from hundreds of public and premium external data sources, including open & commercial LLMs

何を解決するか

Upgini は、機械学習パイプラインに外部データや特徴量を手動で見つけたり統合したりする時間のかかるプロセスを解決する低コードライブラリです。手動のデータ調整や仮説検証を置き換え、ターゲット変数と相関があるだけでなく、実際にモデルの精度を向上させる特徴量のみを自動的に特定するシステムを目指しています。

動作方法

Upgini は知能的なデータ検索エンジンとして機能します。数百もの公開、コミュニティ共有、プレミアム外部データソースに接続できます。大規模言語モデル(LLMs)、グラフニューラルネットワーク(GNNs)、再帰型ニューラルネットワーク(RNNs)を組み合わせて、最適な機械学習特徴量のセットを自動生成・最適化します。また、郵便番号やIPアドレスなどの検索キーを拡張して、利用可能なソース全体にわたって検索範囲を広げることができ、既存のパイプラインにスムーズに統合できるScikit-learn互換インターフェースを提供します。

対象ユーザー

タブラー形式のデータを扱う教師あり学習タスク(二値/多クラス分類、回帰、時系列予測など)に取り組むデータサイエンティストやMLエンジニア向けに開発されています。

主な特徴

  • 自動特徴量発見: ターゲットモデルの精度向上に直接寄与する特徴量を発見します。
  • マルチソース統合: 239カ国にわたる公開、コミュニティ共有、プレミアムデータプロバイダーにアクセス可能です。
  • 検索キーの拡張: 欠落している検索キーを自動的に補完して、データ取得を最大化します。
  • 安定性の検証: 時系列外の期間や検証データセット上で精度向上の有無を確認し、依存性リスクを軽減します。
  • 低コードインターフェース: Scikit-learn互換のPythonライブラリと、ドラッグアンドドロップ式の検索UIを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト