skypilot-org/skypilot
The AI Compute Platform for frontier teams. SkyPilot turns fragmented AI compute into one AI supercomputer, so frontier AI teams build custom intelligence faster.
解决的问题
SkyPilot 简化了在不同基础设施上运行、管理和扩展 AI 工作负载的过程。它通过为在各种云提供商、Kubernetes 集群和 Slurm 集群上部署作业提供统一的接口,同时优化成本和资源可用性,从而消除了供应商锁定。
工作原理
用户使用统一的 YAML 或 Python API 定义其 AI 任务,指定资源需求(如 GPU/TPU)、数据同步需求以及设置/运行命令。SkyPilot 随后会自动完成繁重的工作:寻找最便宜的可用基础设施、配置必要的计算资源(VM 或 pod)、同步代码库、安装依赖项并执行作业。
适用对象
专为需要简单、可移植的作业启动方式的 AI 团队,以及需要统一控制平面来管理跨多个云和集群的 AI 计算、调度和编排的架构团队而设计。
亮点
- 多云和多集群支持:支持 20 多种云(AWS、GCP、Azure 等)、Kubernetes 和 Slurm。
- GPU 集群优化:包括针对空闲资源的 Autostop、共享集群上的 binpacking 以及用于可用性的智能调度器等功能。
- Kubernetes 增强:为 Kubernetes 增加 AI 原生功能,如 gang scheduling、多节点作业和简化的交互式开发(SSH/IDE 连接)。
- AI Agent 集成:提供“SkyPilot Skill”,允许 AI Agent(如 Claude Code)直接管理 GPU 访问和作业。
- 沙箱:能够在现有的 Kubernetes 集群上运行不可信的 LLM 生成代码。