dstackai/dstack
Vendor-agnostic orchestration for training, inference and agentic workloads across NVIDIA, AMD, TPU, and Tenstorrent on clouds, Kubernetes, and bare metal.
해결하는 문제
dstack은 다양한 GPU 클라우드, Kubernetes 및 온프레미스 클러스터를 포함한 다양한 환경에서 GPU 프로비저닝 및 오케스트레이션을 관리하기 위한 통합 컨트롤 플레인을 제공합니다. 이를 통해 AI 개발, 학습 및 추론을 위한 서로 다른 하드웨어 제공업체 및 인프라 설정을 관리하는 복잡성을 제거합니다.
작동 방식
사용자는 dstack 서버와 CLI를 설정하여 컴퓨팅 리소스를 관리합니다. 시스템은 YAML 구성을 사용하여 다음 구성 요소를 정의합니다:
- Fleets: 클라우드 및 온프레미스 전반의 클러스터 프로비저닝 및 관리용.
- Dev environments: IDE 또는 AI 에이전트를 통해 액세스할 수 있는 환경 실행용.
- Tasks: 단일 노드 또는 클러스터에서 학습 또는 배치 작업 실행용.
- Services: 확장 가능한 엔드포인트로 모델 추론을 배포하기 위함.
- Volumes: 인스턴스 및 네트워크 볼륨을 통한 데이터 지속성 관리용.
- Presets: 추론을 위한 실험적인 에이전트 기반 최적화.
이러한 구성은 CLI, API 또는 AI 에이전트 스킬을 통해 적용되며, dstack은 자동 확장, 네트워킹, 포트 포워딩 및 오류 복구(예: 용량 부족 오류)와 같은 기본 인프라 작업을 자동으로 처리합니다.
대상 사용자
모델 학습 및 배포를 위해 여러 GPU 클라우드 또는 온프레미스 클러스터에 걸쳐 컴퓨팅 리소스를 오케스트레이션해야 하는 AI 개발자 및 ML 엔지니어.
주요 특징
- 폭넓은 하드웨어 지원: NVIDIA, AMD, Google TPU 및 Tenstorrent 가속기와 즉시 호환됩니다.
- 에이전트 준비 완료: AI 에이전트(Claude 또는 Cursor 등)가 Fleets를 관리하고 워크로드를 제출할 수 있도록 하는 특정 "스킬"이 포함되어 있습니다.
- 통합 컨트롤 플레인: 하이브리드 클라우드/온프레미스 설정 전반의 개발, 학습 및 추론을 관리하기 위한 단일 인터페이스.
- 자동화된 인프라: 작업 큐잉, 자동 확장 및 실행 실패를 자동으로 처리합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트