volcano-sh/volcano

A Cloud Native Batch System (Project under CNCF)

解決する課題

Volcanoは、高性能なバッチ処理やエラスティックなワークロードを扱う際の、標準的なKubernetesスケジューラの制限に対処するために設計されています。大規模なクラスター全体で効率的なリソース割り当てと最適化を必要とするAI、機械学習、ディープラーニング、およびビッグデータアプリケーションに必要な、特化したスケジューリング機能を提供します。

仕組み

Volcanoは、標準の kube-scheduler を拡張・強化し、Kubernetesネイティブなバッチスケジューリングシステムを構築します。幅広いAIおよびHPCフレームワーク(PyTorch、TensorFlow、Ray、Sparkなど)と統合し、これらのワークロードがクラスター全体にどのように分散されるかを管理し、ハイパフォーマンスコンピューティング(HPC)のベストプラクティスをクラウドネイティブな環境に取り入れます。

対象ユーザー

Kubernetes上で大規模なAI/MLトレーニング、バイオインフォマティクス、ゲノミクス、およびビッグデータ分析プラットフォームを実行しているエンジニアや組織、特にKubeflow、Spark、Flinkなどのフレームワークを使用している方を対象としています。

ハイライト

  • 幅広いフレームワーク統合: PyTorch、TensorFlow、Ray、Spark、Flink、およびMPIを強力にサポート。
  • CNCF Incubating Project: Cloud Native Computing Foundationのエコシステムの一部。
  • 高性能への特化: AI、ディープラーニング、およびLLMトレーニングワークフローに特化して最適化。
  • Cloud-nativeアーキテクチャ: クラスターのリソース管理とシームレスな統合を保証するため、Kubernetesネイティブなシステムとして構築。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト