IBM/AutoMLPipeline.jl

A package that makes it trivial to create and evaluate machine learning pipeline architectures.

何を解決するか

AutoMLPipeline (AMLP) は、複雑な機械学習パイプラインの作成と最適化を簡素化します。ユーザーが同時に最適な前処理ステップの順序(特徴量抽出、変換、選択)と、回帰または分類タスクに最も効果的なモデルおよびハイパーパラメータを決定する必要がある「パイプライン最適化問題」(POP)に対処します。

仕組み

AMLP は Julia のマクロプログラミングを使用して、シンボリック式を使って ML ワークフローを定義できるようにします。|> は操作のシーケンスを、+ は並列な特徴量処理パスの連結を表す簡潔な構文を採用しています。

たとえば、カテゴリカル特徴量をワンホットエンコーディングで処理し、数値特徴量を PCA で処理した後、それらを結合してランダムフォレストモデルに渡すパイプラインを定義できます。このパッケージは Scikit-learn や DecisionTree などの人気ライブラリのラッパーを提供し、fit!transform! インターフェースをオーバーロードすることで、新しいコンポーネントの追加が容易です。

対象ユーザー

分類および回帰用の機械学習パイプラインの構造を迅速にプロトタイピング・実験・最適化したいデータサイエンティストや ML プラクティショナー向けに設計されています。

特徴

  • シンボリックパイプライン API:シンプルな数学的表記を使って複雑なワークフローを高レベルで記述可能。
  • 拡張可能なアーキテクチャ:2つの主要インターフェースを実装することで、新しいコンポーネントを簡単に追加可能。
  • メタアンサンブル:より堅牢な予測を実現するためのアンサンブルの再帰的構成をサポート。
  • 特徴量選択ツール:カテゴリカル特徴量と数値特徴量を分離し、専用の前処理に利用可能。
  • 広範な統合:Scikit-learn および他の ML ライブラリのラッパーを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト