aws/sagemaker-spark
A Spark library for Amazon SageMaker.
解決的問題
SageMaker Spark 允許使用者將 Amazon SageMaker 的機器學習功能直接整合至 Apache Spark ML 流水線中。它解決了 Spark 中大規模資料處理與 SageMaker 的托管訓練與托管基礎設施之間的落差問題,讓使用者能於 Spark DataFrames 上大規模地進行模型訓練與推論。
作法
此套件提供 SageMakerEstimator 與 SageMakerModel 類別,可順暢整合至標準 Spark ML Pipeline API 中。
- 訓練:當對 Spark DataFrame 呼叫
fit()時,套件會序列化資料,上傳至 S3,並使用 Amazon 提供的演算法(如 XGBoost 或 K-Means)或 Docker 容器中的自訂演算法觸發 SageMaker 訓練工作。 - 託管:訓練完成後,自動建立 SageMaker 端點以託管模型。
- 推論:當呼叫
transform()時,套件會將 Spark DataFrame 的資料區塊序列化,並透過InvokeEndpointAPI 發送到 SageMaker 端點,再將預測結果附加回 DataFrame。
適用對象
使用 Apache Spark 進行資料準備,並希望在不離開 Spark 生態系的情況下,利用 Amazon SageMaker 實現可擴展模型訓練與部署的資料工程師與機器學習實務者。
主要特色
- Spark 流水線整合:可將原生 Spark ML 階段與 SageMaker 訓練與託管階段混合使用。
- 彈性演算法支援:支援 SageMaker 內建演算法或基於 Docker 的自訂演算法。
- SBOM 支援:支援 Scala 與 Python(透過 PySpark)。
- 可擴展推論:透過與託管的 SageMaker 端點互動,在 Spark DataFrames 上執行預測。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch