dstackai/dstack

Vendor-agnostic orchestration for training, inference and agentic workloads across NVIDIA, AMD, TPU, and Tenstorrent on clouds, Kubernetes, and bare metal.

해결하는 문제

dstack은 다양한 GPU 클라우드, Kubernetes 및 온프레미스 클러스터를 포함한 다양한 환경에서 GPU 프로비저닝 및 오케스트레이션을 관리하기 위한 통합 컨트롤 플레인을 제공합니다. 이를 통해 AI 개발, 학습 및 추론을 위한 서로 다른 하드웨어 제공업체 및 인프라 설정을 관리하는 복잡성을 제거합니다.

작동 방식

사용자는 dstack 서버와 CLI를 설정하여 컴퓨팅 리소스를 관리합니다. 시스템은 YAML 구성을 사용하여 다음 구성 요소를 정의합니다:

  • Fleets: 클라우드 및 온프레미스 전반의 클러스터 프로비저닝 및 관리용.
  • Dev environments: IDE 또는 AI 에이전트를 통해 액세스할 수 있는 환경 실행용.
  • Tasks: 단일 노드 또는 클러스터에서 학습 또는 배치 작업 실행용.
  • Services: 확장 가능한 엔드포인트로 모델 추론을 배포하기 위함.
  • Volumes: 인스턴스 및 네트워크 볼륨을 통한 데이터 지속성 관리용.
  • Presets: 추론을 위한 실험적인 에이전트 기반 최적화.

이러한 구성은 CLI, API 또는 AI 에이전트 스킬을 통해 적용되며, dstack은 자동 확장, 네트워킹, 포트 포워딩 및 오류 복구(예: 용량 부족 오류)와 같은 기본 인프라 작업을 자동으로 처리합니다.

대상 사용자

모델 학습 및 배포를 위해 여러 GPU 클라우드 또는 온프레미스 클러스터에 걸쳐 컴퓨팅 리소스를 오케스트레이션해야 하는 AI 개발자 및 ML 엔지니어.

주요 특징

  • 폭넓은 하드웨어 지원: NVIDIA, AMD, Google TPU 및 Tenstorrent 가속기와 즉시 호환됩니다.
  • 에이전트 준비 완료: AI 에이전트(Claude 또는 Cursor 등)가 Fleets를 관리하고 워크로드를 제출할 수 있도록 하는 특정 "스킬"이 포함되어 있습니다.
  • 통합 컨트롤 플레인: 하이브리드 클라우드/온프레미스 설정 전반의 개발, 학습 및 추론을 관리하기 위한 단일 인터페이스.
  • 자동화된 인프라: 작업 큐잉, 자동 확장 및 실행 실패를 자동으로 처리합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트