dstackai/dstack

Vendor-agnostic orchestration for training, inference and agentic workloads across NVIDIA, AMD, TPU, and Tenstorrent on clouds, Kubernetes, and bare metal.

解决的问题

dstack 提供了一个统一的控制平面,用于在包括各种 GPU 云、Kubernetes 和本地集群在内的多种环境中管理 GPU 配置和编排。它消除了为 AI 开发、训练和推理管理不同硬件供应商和基础设施设置的复杂性。

工作原理

用户设置 dstack 服务器和 CLI 来管理其计算资源。系统使用 YAML 配置来定义以下组件:

  • Fleets: 用于跨云和本地配置及管理集群。
  • Dev environments: 用于启动可通过 IDE 或 AI Agent 访问的环境。
  • Tasks: 用于在单个节点或集群上运行训练或批处理作业。
  • Services: 用于将模型推理部署为可扩展的端点。
  • Volumes: 用于通过实例和网络卷管理数据持久性。
  • Presets: 用于推理的实验性 Agent 驱动优化。

这些配置通过 CLI、API 或 AI Agent 技能应用,dstack 会自动处理底层基础设施任务,如自动扩缩容、网络、端口转发和错误恢复(例如:容量不足错误)。

适用对象

需要跨多个 GPU 云或本地集群编排计算资源以进行模型训练和部署的 AI 开发人员和 ML 工程师。

亮点

  • 广泛的硬件支持: 开箱即用支持 NVIDIA、AMD、Google TPU 和 Tenstorrent 加速器。
  • Agent 就绪: 包含特定的“技能”,允许 AI Agent(如 Claude 或 Cursor)管理 Fleets 并提交工作负载。
  • 统一控制平面: 用于在混合云/本地设置中管理开发、训练和推理的单一界面。
  • 自动化基础设施: 自动处理作业排队、自动扩缩容和运行失败。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目