aws/sagemaker-spark

A Spark library for Amazon SageMaker.

何を解決するか

SageMaker Spark は、ユーザーが Amazon SageMaker の機械学習機能を Apache Spark ML パイプラインに直接統合できるようにします。Spark での大規模なデータ処理と SageMaker のマネージドなトレーニングおよびホスティングインフラの間のギャップを埋める問題を解決し、Spark DataFrames 上でスケーラブルにモデルのトレーニングと推論を実行できるようにします。

動作方法

このライブラリは、標準的な Spark ML Pipeline API に統合できる SageMakerEstimator および SageMakerModel クラスを提供します。

  1. トレーニング: Spark DataFrame に対して fit() を呼び出すと、ライブラリはデータをシリアライズし、S3 にアップロードし、Amazon が提供するアルゴリズム(XGBoost や K-Means など)または Docker コンテナ内のカスタムアルゴリズムを使って SageMaker トレーニングジョブを開始します。
  2. ホスティング: トレーニングが完了すると、自動的に SageMaker エンドポイントを作成してモデルをホストします。
  3. 推論: transform() を呼び出すと、ライブラリは Spark DataFrame のチャンクをシリアライズし、InvokeEndpoint API を介して SageMaker エンドポイントに送信し、予測結果を DataFrame に追加します。

対象ユーザー

データ準備に Apache Spark を使用し、スケーラブルなモデルトレーニングとデプロイに Amazon SageMaker を活用したいデータエンジニアや ML プラクティショナー。

特徴

  • Spark パイプライン統合: ネイティブな Spark ML ステージと SageMaker トレーニングおよびホスティングステージを混合して使用可能。
  • 柔軟なアルゴリズム対応: SageMaker の組み込みアルゴリズムまたはカスタム Docker ベースのアルゴリズムに対応。
  • SBOM 対応: Scala および Python(PySpark 経由)の両方をサポート。
  • スケーラブルな推論: ホストされた SageMaker エンドポイントと連携して、Spark DataFrames 上で予測を実行。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch