microsoft/SynapseML
Simple and Distributed Machine Learning Python Library porting ML algorithms for Spark
何を解決するか
SynapseMLは、大規模な機械学習パイプラインの構築を簡素化します。テキスト解析、コンピュータビジョン、異常検出などのタスク向けのインテリジェントなシステムを、単一ノード、マルチノード、および弾性的にリサイズ可能なコンピュータクラスタ全体でスケーラブルに構築できます。
仕組み
Apache Spark分散コンピューティングフレームワーク上で構築されており、SparkML/MLLibライブラリと同じAPIを持つ組み合わせ可能で分散型のAPIを提供します。これにより、モデルを既存のApache Sparkワークフローにスムーズに統合できます。さまざまなデータベース、ファイルシステム、クラウドデータストアを抽象化することで、場所に関係なくデータアクセスを簡素化します。
対象ユーザー
Apache Sparkを使用し、Python、R、Scala、Java、または.NETで大規模なMLパイプラインを構築するデータサイエンティストおよびMLエンジニア。
主な特徴
- Vowpal Wabbit on Spark: 高速かつ効果的なテキスト解析。
- The Cognitive Services for Big Data: 大規模なMicrosoft Cognitive Servicesとの統合。
- LightGBM on Spark: グラデーションブースティングマシンの分散学習。
- Spark Serving: ミリ秒未満のレイテンシでSpark計算をウェブサービスとして提供する機能。
- ONNX on Spark: 分散型かつハードウェアアクセラレートされたモデル推論。
- Responsible AI: 不透明なモデルの理解とデータセットバイアスの測定に役立つツール。
- Isolation Forest on Spark: 分散型の非線形外れ値検出。
- HTTP on Spark: SparkとHTTPの統合により、分散マイクロサービスオーケストレーションが可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト