microsoft/SynapseML

Simple and Distributed Machine Learning Python Library porting ML algorithms for Spark

解決的問題

SynapseML 簡化了大規模機器學習流程的建立。它讓使用者能建構用於文字分析、電腦視覺與異常偵測等任務的智慧系統,這些系統可跨單一節點、多節點,以及彈性可調整的電腦叢集進行擴展。

如何運作

基於 Apache Spark 分散式運算框架建構,SynapseML 提供可組合且分散式的 API,與 SparkML/MLLib 庫的 API 相同。這讓模型能無縫嵌入至現有的 Apache Spark 工作流程中。它抽象了各種資料庫、檔案系統與雲端資料儲存,無論資料位置為何,都能簡化資料存取。

適用對象

使用 Apache Spark 並以 Python、R、Scala、Java 或 .NET 建構大型 ML 流程的資料科學家與 ML 工程師。

主要特色

  • Vowpal Wabbit on Spark: 快速且有效的文字分析。
  • The Cognitive Services for Big Data: 大規模整合 Microsoft Cognitive Services。
  • LightGBM on Spark: 分散式梯度提升機訓練。
  • Spark Serving: 可以以亞毫秒級延遲將 Spark 計算作為 Web 服務提供。
  • ONNX on Spark: 分散式且硬體加速的模型推論。
  • Responsible AI: 工具用於理解黑箱模型並測量資料集偏見。
  • Isolation Forest on Spark: 分散式非線性異常偵測。
  • HTTP on Spark: Spark 與 HTTP 的整合,支援分散式微服務編排。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案