kruize/autotune

Autonomous Performance Tuning for Kubernetes!

解决的问题

Kruize 解决了手动调整 Kubernetes 资源分配的挑战。通过自动建议工作负载所需的 CPU、内存和 GPU 资源的正确数量,防止资源过度分配(浪费资金)和资源不足分配(降低应用性能)。

工作原理

Kruize 连接到监控堆栈(如 Prometheus 或 Thanos),分析历史资源使用模式。它利用元数据和指标配置文件来理解环境,并定义什么是“良好性能”。基于此分析,它为以下内容生成资源优化建议:

  • 容器:CPU 和内存的请求和限制。
  • 命名空间:资源配额限制。
  • NVIDIA GPU:A100 和 H100 加速器的最优 MIG 切片配置。
  • 应用运行时:JVM 和 Quarkus 等框架的优化配置(Alpha)。

用户可以选择成本优化或性能优化的配置文件,并设置自定义观察窗口。

适用人群

专为 Kubernetes 和 OpenShift 管理员以及 DevOps 工程师设计,帮助他们无需手动试错即可降低基础设施成本并提升工作负载稳定性。

主要亮点

  • 多资源支持:优化 CPU、内存和 GPU(MIG 切片)。
  • GPU 优化:特别支持 NVIDIA A100 和 H100 加速器。
  • 集成能力:与 Prometheus 和 Thanos 集成用于数据收集。
  • 灵活配置:提供预设和自定义的观察窗口及优化目标(成本 vs. 性能)。
  • 部署方式:通过专用 Operator 提供,便于管理。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目