microsoft/SynapseML
Simple and Distributed Machine Learning Python Library porting ML algorithms for Spark
해결하는 문제
SynapseML은 대규모 기계학습 파이프라인을 쉽게 만들 수 있도록 도와줍니다. 단일 노드, 다중 노드, 그리고 유연하게 확장 가능한 컴퓨터 클러스터 전체에서 텍스트 분석, 컴퓨터 비전, 이상 탐지와 같은 작업을 위한 지능형 시스템을 확장 가능하게 구축할 수 있습니다.
작동 방식
Apache Spark 분산 컴퓨팅 프레임워크 위에 구축되어 있으며, SparkML/MLLib 라이브러리와 동일한 API를 제공하는 조합 가능하고 분산형 API를 제공합니다. 이로 인해 모델을 기존 Apache Spark 워크플로우에 원활하게 통합할 수 있습니다. 다양한 데이터베이스, 파일 시스템, 클라우드 데이터 스토어를 추상화하여 위치에 관계없이 데이터 접근을 간소화합니다.
대상 사용자
Apache Spark를 사용하고 Python, R, Scala, Java, 또는 .NET을 사용하여 대규모 ML 파이프라인을 구축하는 데이터 과학자 및 ML 엔지니어.
주요 기능
- Vowpal Wabbit on Spark: 빠르고 효과적인 텍스트 분석.
- The Cognitive Services for Big Data: 대규모에서 Microsoft Cognitive Services와의 통합.
- LightGBM on Spark: 그래디언트 부스팅 머신의 분산 학습.
- Spark Serving: 밀리초 미만의 지연 시간으로 Spark 계산을 웹 서비스로 제공할 수 있는 기능.
- ONNX on Spark: 분산 및 하드웨어 가속화된 모델 추론.
- Responsible AI: 투명하지 않은 모델을 이해하고 데이터셋 편향을 측정하는 도구.
- Isolation Forest on Spark: 분산형 비선형 이상 탐지.
- HTTP on Spark: Spark와 HTTP 간의 통합을 통해 분산 마이크로서비스 오케스트레이션 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트