clearml/clearml-agent
ClearML Agent - MLOps/LLMOps made easy. MLOps/LLMOps scheduler & orchestration solution
What it solves
ClearML Agent は、ゼロ構成のオーケストレーションおよびスケジューリング・ソリューションを提供することで、MLOps および LLMOps の複雑さを解決します。ローカルとクラウドベースの GPU/CPU リソースのハイブリッド・クラスター全体で機械学習実験を実行するために、手動の環境構築、YAML/JSON 設定、または深い DevOps の知識を必要とすることを排除します。
How it works
エージェントは、ClearML Server 上の特定のキューを監視するジョブ・スケジューラーとして機能します。UI または API を介して実験がキューに入れられると、エージェントは次のように動作します:
- 仮想環境を作成するか、指定された Docker コンテナを起動します。
- 必要なコードを Git リポジトリからクローンします。
- 必要な Python パッケージをインストールします(マシンの CUDA バージョンに基づいて PyTorch バージョンを自動的に選択します)。
- コードを実行し、その進捗を監視しながら、すべての出力(stdout/stderr)を ClearML UI にログとして書き戻します。
ベアメタル、VM、または Kubernetes(ClearML ジョブを K8s ジョブにマッピングする「Glue mode」を含む)上で実行可能です。また、Python、Git、および UV のプリコンパイル済みバイナリを提供することで、コールドスタートを高速化する「Bootstrap」システムも利用可能です。
Who it’s for
インフラストラクチャ管理やコンテナ・オーケストレーションに多大な時間を費やすことなく、単一のマシンから動的なクラスターへと実験をスケールアップさせる必要がある ML 研究者およびエンジニア向けに設計されています。
Highlights
- Hybrid Resource Management: オンプレミスと複数のクラウド・プロバイダーにわたる GPU リソースを組み合わせることができます。
- Zero-Config Execution: ジョブを起動するために、手動のテンプレートや設定ファイルは必要ありません。
- Flexible Deployment: virtualenv、Docker、Kubernetes、および SLURM をサポートしています。
- Priority Scheduling: 重要なジョブが最初に実行されることを保証するために、優先度付きキューをサポートしています。
- Rapid Bootstrapping: 自己完結型の bootstrap システムを使用して、エージェントの起動を最大 10 倍高速化します。
- Services Mode: オートスケーリング、コントローラー、またはオプティマイザー用の長時間実行されるサービス・コンテナを起動する機能があります。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト