microsoft/SynapseML

Simple and Distributed Machine Learning Python Library porting ML algorithms for Spark

解决的问题

SynapseML 简化了大规模机器学习流水线的创建。它允许用户构建用于文本分析、计算机视觉和异常检测等任务的智能系统,这些系统可以在单节点、多节点以及可弹性扩展的计算机集群上进行扩展。

工作原理

基于 Apache Spark 分布式计算框架构建,SynapseML 提供可组合且分布式的 API,与 SparkML/MLLib 库的 API 相同。这使得模型可以无缝嵌入到现有的 Apache Spark 工作流中。它抽象了各种数据库、文件系统和云数据存储,无论数据位置如何,都能简化数据访问。

适用人群

使用 Apache Spark 并使用 Python、R、Scala、Java 或 .NET 构建大规模 ML 流水线的数据科学家和 ML 工程师。

主要亮点

  • Vowpal Wabbit on Spark: 快速有效的文本分析。
  • The Cognitive Services for Big Data: 大规模集成 Microsoft Cognitive Services。
  • LightGBM on Spark: 分布式梯度提升机训练。
  • Spark Serving: 可以以亚毫秒级延迟将 Spark 计算作为 Web 服务提供。
  • ONNX on Spark: 分布式且硬件加速的模型推理。
  • Responsible AI: 工具用于理解黑箱模型并测量数据集偏差。
  • Isolation Forest on Spark: 分布式非线性异常检测。
  • HTTP on Spark: Spark 与 HTTP 的集成,支持分布式微服务编排。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目