volcano-sh/volcano

A Cloud Native Batch System (Project under CNCF)

解决的问题

Volcano 旨在解决标准 Kubernetes 调度器在处理高性能批处理和弹性工作负载时的局限性。它为 AI、机器学习、深度学习和大数据应用提供专门的调度能力,这些应用需要在大规模集群中进行高效的资源分配和优化。

工作原理

Volcano 通过扩展和增强标准 kube-scheduler 来创建一个 Kubernetes 原生的批处理调度系统。它与广泛的 AI 和 HPC 框架(如 PyTorch、TensorFlow、Ray 和 Spark)集成,管理这些工作负载在集群中的分布方式,并将高性能计算 (HPC) 的最佳实践融入到云原生环境中。

适用对象

适用于在 Kubernetes 上运行大规模 AI/ML 训练、生物信息学、基因组学和大数据分析平台的工程师和组织,特别是那些使用 Kubeflow、Spark 或 Flink 等框架的用户。

亮点

  • 广泛的框架集成:对 PyTorch、TensorFlow、Ray、Spark、Flink 和 MPI 提供强大的支持。
  • CNCF 孵化项目:属于 Cloud Native Computing Foundation 生态系统的一部分。
  • 专注于高性能:专门针对 AI、深度学习和 LLM 训练工作流进行了优化。
  • 云原生架构:作为 Kubernetes 原生系统构建,确保与集群资源管理的无缝集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目