raids-lab/crater

Crater is a cloud-native AI training & inference platform.

解决的问题

Crater 提供一个 Kubernetes 原生的控制平面,用于管理共享 AI 计算集群。它消除了直接使用原始 Kubernetes 进行多租户 GPU 资源管理的复杂性,用统一的界面替代手动 YAML 清单,实现对用户、配额和 AI 工作负载的集中治理。

工作原理

基于 Kubernetes 和 Volcano 构建,Crater 添加了一个操作层,将用户、账户和队列与底层计算资源连接起来。它管理 AI 工作负载的全生命周期——包括 LLM 训练、推理服务和交互式开发环境——同时提供一个集中式系统来管理数据集、模型和容器镜像。

适用人群

适用于需要在多个团队、学生或项目之间共享单一 GPU 集群的大学、研究机构、企业 AI 团队以及平台工程师。

核心亮点

  • 多租户治理:管理账户、配额和审批,确保资源分配的公平性和可问责性。
  • 策略感知调度:利用 Volcano 实现基于队列的准入控制和跨异构加速器(NVIDIA 等)的优先级感知执行。
  • 交互式工作区:一键部署容器化的 Jupyter、WebIDE 和终端。
  • 资产管理:集中组织模型、数据集和镜像,供多个工作负载复用。
  • AI 辅助运维:提供 Web 控制台、CLI 和面向代理的接口,实现自动化和智能化的集群管理。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目