combust/mleap
MLeap: Deploy ML Pipelines to Production
何を解決するか
機械学習パイプラインのデプロイは、通常、トレーニングに使用される環境(Apache Spark や Scikit-learn など)が重く、生産環境に含めるのが高コストであるため、困難です。MLeap は、これらのパイプラインを、元のトレーニングフレームワークの依存関係を必要とせずに実行可能なポータブル形式にエクスポートする方法を提供します。
動作方法
MLeap は、トレーニング済みパイプラインの状態を保存するためのシリアル化形式「Bundle.ML」(JSON および Protobuf で利用可能)を使用します。エクスポート後、軽量な MLeap Runtime(Scala で実装され、JVM 上で実行)上でパイプラインを実行できます。これにより、スコアリング/推論フェーズで Spark、Scikit-learn、NumPy、Pandas を必要としなくなります。
対象ユーザー
Spark や Scikit-learn でトレーニングされた機械学習パイプラインを、パフォーマンスと低オーバーヘッドが求められる生産環境にデプロイする必要があるデータサイエンティストやエンジニア。
主な特徴
- フレームワーク非依存の実行: Spark や Scikit-learn でトレーニングされたパイプラインを、単一の軽量 JVM ランタイム上で実行可能。
- ポータブルフォーマット: パイプラインバンドル用に JSON および Protobuf シリアル化をサポート。
- 同等性テスト: MLeap パイプラインの出力が元の Spark パイプラインと一致することを保証するテストを含む。
- 拡張性: カスタムトランスフォーマーおよびデータ型の実装を可能にする。
- 広範な互換性: Spark、Scala、Java、Python、XGBoost、TensorFlow など、幅広いバージョンをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト