aws/sagemaker-spark

A Spark library for Amazon SageMaker.

解決的問題

SageMaker Spark 允許使用者將 Amazon SageMaker 的機器學習功能直接整合至 Apache Spark ML 流水線中。它解決了 Spark 中大規模資料處理與 SageMaker 的托管訓練與托管基礎設施之間的落差問題,讓使用者能於 Spark DataFrames 上大規模地進行模型訓練與推論。

作法

此套件提供 SageMakerEstimatorSageMakerModel 類別,可順暢整合至標準 Spark ML Pipeline API 中。

  1. 訓練:當對 Spark DataFrame 呼叫 fit() 時,套件會序列化資料,上傳至 S3,並使用 Amazon 提供的演算法(如 XGBoost 或 K-Means)或 Docker 容器中的自訂演算法觸發 SageMaker 訓練工作。
  2. 託管:訓練完成後,自動建立 SageMaker 端點以託管模型。
  3. 推論:當呼叫 transform() 時,套件會將 Spark DataFrame 的資料區塊序列化,並透過 InvokeEndpoint API 發送到 SageMaker 端點,再將預測結果附加回 DataFrame。

適用對象

使用 Apache Spark 進行資料準備,並希望在不離開 Spark 生態系的情況下,利用 Amazon SageMaker 實現可擴展模型訓練與部署的資料工程師與機器學習實務者。

主要特色

  • Spark 流水線整合:可將原生 Spark ML 階段與 SageMaker 訓練與託管階段混合使用。
  • 彈性演算法支援:支援 SageMaker 內建演算法或基於 Docker 的自訂演算法。
  • SBOM 支援:支援 Scala 與 Python(透過 PySpark)。
  • 可擴展推論:透過與託管的 SageMaker 端點互動,在 Spark DataFrames 上執行預測。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch