dstackai/dstack

Vendor-agnostic orchestration for training, inference and agentic workloads across NVIDIA, AMD, TPU, and Tenstorrent on clouds, Kubernetes, and bare metal.

解決する課題

dstackは、さまざまなGPUクラウド、Kubernetes、オンプレミス・クラスターを含む多様な環境にわたって、GPUのプロビジョニングとオーケストレーションを管理するための統合コントロールプレーンを提供します。これにより、AIの開発、学習、推論における、異なるハードウェアプロバイダーやインフラストラクチャ設定の管理に伴う複雑さを解消します。

仕組み

ユーザーはdstackサーバーとCLIをセットアップして、コンピューティングリソースを管理します。システムはYAML設定を使用して、以下のコンポーネントを定義します:

  • Fleets: クラウドおよびオンプレミスにわたるクラスターのプロビジョニングと管理用。
  • Dev environments: IDEやAIエージェントからアクセス可能な環境の起動用。
  • Tasks: 単一ノードまたはクラスター上での学習またはバッチジョブの実行用。
  • Services: スケーラブルなエンドポイントとしてモデル推論をデプロイするため。
  • Volumes: インスタンスおよびネットワークボリュームを介したデータ永続性の管理用。
  • Presets: 推論のための実験的なエージェント駆動型最適化。

これらの設定は、CLI、API、またはAIエージェントのスキルを通じて適用され、dstackはオートスケーリング、ネットワーキング、ポートフォワーディング、エラーリカバリ(例:容量不足エラー)などの基礎となるインフラストラクチャタスクを自動的に処理します。

対象ユーザー

モデルの学習やデプロイのために、複数のGPUクラウドやオンプレミス・クラスターにわたってコンピューティングリソースをオーケストレートする必要があるAI開発者およびMLエンジニア。

ハイライト

  • 幅広いハードウェアサポート: NVIDIA、AMD、Google TPU、Tenstorrentアクセラレータでそのまま動作します。
  • エージェント対応: AIエージェント(ClaudeやCursorなど)がFleetsを管理し、ワークロードを送信できるようにするための特定の「スキル」が含まれています。
  • 統合コントロールプレーン: ハイブリッドクラウド/オンプレミスのセットアップにわたる開発、学習、推論を管理するための単一のインターフェース。
  • 自動化されたインフラストラクチャ: ジョブキューイング、オートスケーリング、実行失敗を自動的に処理します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト