combust/mleap

MLeap: Deploy ML Pipelines to Production

何を解決するか

機械学習パイプラインのデプロイは、通常、トレーニングに使用される環境(Apache Spark や Scikit-learn など)が重く、生産環境に含めるのが高コストであるため、困難です。MLeap は、これらのパイプラインを、元のトレーニングフレームワークの依存関係を必要とせずに実行可能なポータブル形式にエクスポートする方法を提供します。

動作方法

MLeap は、トレーニング済みパイプラインの状態を保存するためのシリアル化形式「Bundle.ML」(JSON および Protobuf で利用可能)を使用します。エクスポート後、軽量な MLeap Runtime(Scala で実装され、JVM 上で実行)上でパイプラインを実行できます。これにより、スコアリング/推論フェーズで Spark、Scikit-learn、NumPy、Pandas を必要としなくなります。

対象ユーザー

Spark や Scikit-learn でトレーニングされた機械学習パイプラインを、パフォーマンスと低オーバーヘッドが求められる生産環境にデプロイする必要があるデータサイエンティストやエンジニア。

主な特徴

  • フレームワーク非依存の実行: Spark や Scikit-learn でトレーニングされたパイプラインを、単一の軽量 JVM ランタイム上で実行可能。
  • ポータブルフォーマット: パイプラインバンドル用に JSON および Protobuf シリアル化をサポート。
  • 同等性テスト: MLeap パイプラインの出力が元の Spark パイプラインと一致することを保証するテストを含む。
  • 拡張性: カスタムトランスフォーマーおよびデータ型の実装を可能にする。
  • 広範な互換性: Spark、Scala、Java、Python、XGBoost、TensorFlow など、幅広いバージョンをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト