clearml/clearml-agent

ClearML Agent - MLOps/LLMOps made easy. MLOps/LLMOps scheduler & orchestration solution

What it solves

ClearML Agent は、ゼロ構成のオーケストレーションおよびスケジューリング・ソリューションを提供することで、MLOps および LLMOps の複雑さを解決します。ローカルとクラウドベースの GPU/CPU リソースのハイブリッド・クラスター全体で機械学習実験を実行するために、手動の環境構築、YAML/JSON 設定、または深い DevOps の知識を必要とすることを排除します。

How it works

エージェントは、ClearML Server 上の特定のキューを監視するジョブ・スケジューラーとして機能します。UI または API を介して実験がキューに入れられると、エージェントは次のように動作します:

  1. 仮想環境を作成するか、指定された Docker コンテナを起動します。
  2. 必要なコードを Git リポジトリからクローンします。
  3. 必要な Python パッケージをインストールします(マシンの CUDA バージョンに基づいて PyTorch バージョンを自動的に選択します)。
  4. コードを実行し、その進捗を監視しながら、すべての出力(stdout/stderr)を ClearML UI にログとして書き戻します。

ベアメタル、VM、または Kubernetes(ClearML ジョブを K8s ジョブにマッピングする「Glue mode」を含む)上で実行可能です。また、Python、Git、および UV のプリコンパイル済みバイナリを提供することで、コールドスタートを高速化する「Bootstrap」システムも利用可能です。

Who it’s for

インフラストラクチャ管理やコンテナ・オーケストレーションに多大な時間を費やすことなく、単一のマシンから動的なクラスターへと実験をスケールアップさせる必要がある ML 研究者およびエンジニア向けに設計されています。

Highlights

  • Hybrid Resource Management: オンプレミスと複数のクラウド・プロバイダーにわたる GPU リソースを組み合わせることができます。
  • Zero-Config Execution: ジョブを起動するために、手動のテンプレートや設定ファイルは必要ありません。
  • Flexible Deployment: virtualenv、Docker、Kubernetes、および SLURM をサポートしています。
  • Priority Scheduling: 重要なジョブが最初に実行されることを保証するために、優先度付きキューをサポートしています。
  • Rapid Bootstrapping: 自己完結型の bootstrap システムを使用して、エージェントの起動を最大 10 倍高速化します。
  • Services Mode: オートスケーリング、コントローラー、またはオプティマイザー用の長時間実行されるサービス・コンテナを起動する機能があります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト