microsoft/SynapseML

Simple and Distributed Machine Learning Python Library porting ML algorithms for Spark

何を解決するか

SynapseMLは、大規模な機械学習パイプラインの構築を簡素化します。テキスト解析、コンピュータビジョン、異常検出などのタスク向けのインテリジェントなシステムを、単一ノード、マルチノード、および弾性的にリサイズ可能なコンピュータクラスタ全体でスケーラブルに構築できます。

仕組み

Apache Spark分散コンピューティングフレームワーク上で構築されており、SparkML/MLLibライブラリと同じAPIを持つ組み合わせ可能で分散型のAPIを提供します。これにより、モデルを既存のApache Sparkワークフローにスムーズに統合できます。さまざまなデータベース、ファイルシステム、クラウドデータストアを抽象化することで、場所に関係なくデータアクセスを簡素化します。

対象ユーザー

Apache Sparkを使用し、Python、R、Scala、Java、または.NETで大規模なMLパイプラインを構築するデータサイエンティストおよびMLエンジニア。

主な特徴

  • Vowpal Wabbit on Spark: 高速かつ効果的なテキスト解析。
  • The Cognitive Services for Big Data: 大規模なMicrosoft Cognitive Servicesとの統合。
  • LightGBM on Spark: グラデーションブースティングマシンの分散学習。
  • Spark Serving: ミリ秒未満のレイテンシでSpark計算をウェブサービスとして提供する機能。
  • ONNX on Spark: 分散型かつハードウェアアクセラレートされたモデル推論。
  • Responsible AI: 不透明なモデルの理解とデータセットバイアスの測定に役立つツール。
  • Isolation Forest on Spark: 分散型の非線形外れ値検出。
  • HTTP on Spark: SparkとHTTPの統合により、分散マイクロサービスオーケストレーションが可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト