dstackai/dstack
Vendor-agnostic orchestration for training, inference and agentic workloads across NVIDIA, AMD, TPU, and Tenstorrent on clouds, Kubernetes, and bare metal.
解決的問題
dstack 提供了一個統一的控制平面,用於在包括各種 GPU 雲、Kubernetes 和本地集群在內的多元環境中管理 GPU 配置與編排。它消除了為 AI 開發、訓練與推理管理不同硬體供應商與基礎設施設置的複雜性。
工作原理
使用者設定 dstack 伺服器與 CLI 來管理其運算資源。系統使用 YAML 配置來定義以下組件:
- Fleets: 用於跨雲與本地配置及管理集群。
- Dev environments: 用於啟動可透過 IDE 或 AI Agent 存取的環境。
- Tasks: 用於在單一節點或集群上執行訓練或批次作業。
- Services: 用於將模型推理部署為可擴展的端點。
- Volumes: 用於透過實例與網路磁碟管理數據持久性。
- Presets: 用於推理的實驗性 Agent 驅動優化。
這些配置透過 CLI、API 或 AI Agent 技能套用,dstack 會自動處理底層基礎設施任務,如自動擴縮容、網路、連接埠轉發與錯誤復原(例如:容量不足錯誤)。
適用對象
需要跨多個 GPU 雲或本地集群編排運算資源以進行模型訓練與部署的 AI 開發人員與 ML 工程師。
亮點
- 廣泛的硬體支援: 開箱即用支援 NVIDIA、AMD、Google TPU 與 Tenstorrent 加速器。
- Agent 就緒: 包含特定的「技能」,允許 AI Agent(如 Claude 或 Cursor)管理 Fleets 並提交工作負載。
- 統一控制平面: 用於在混合雲/本地設置中管理開發、訓練與推理的單一介面。
- 自動化基礎設施: 自動處理作業排隊、自動擴縮容與執行失敗。
相關
- 專案
- 專案
- 專案
- 專案
- 專案