clearml/clearml-agent

ClearML Agent - MLOps/LLMOps made easy. MLOps/LLMOps scheduler & orchestration solution

解決的問題

ClearML Agent 透過提供零設定的編排與排程解決方案,解決了 MLOps 與 LLMOps 的複雜性。無需手動設定環境、撰寫 YAML/JSON 設定檔,或具備深入的 DevOps 知識,即可在本地與雲端 GPU/CPU 資源組成的混合叢集上執行機器學習實驗。

工作原理

該代理作為作業排程器,監聽 ClearML Server 上的特定佇列。當透過 UI 或 API 將實驗加入佇列時,代理會:

  1. 建立虛擬環境或啟動指定的 Docker 容器。
  2. 從 Git 倉庫克隆所需程式碼。
  3. 安裝必要的 Python 套件(根據機器的 CUDA 版本自動選擇 PyTorch 版本)。
  4. 執行程式碼並監控其進度,將所有輸出(stdout/stderr)記錄回 ClearML UI。

它可在裸機、虛擬機或 Kubernetes 上執行(包含將 ClearML 作業映射至 K8s 作業的「Glue 模式」)。亦提供一個「Bootstrap」系統,透過提供 Python、Git 與 UV 的預編譯二進位檔,加速冷啟動。

適用對象

專為需要將實驗從單一機器擴展至動態叢集的機器學習研究人員與工程師設計,無需花費大量時間在基礎設施管理或容器編排上。

主要亮點

  • 混合資源管理:整合本地與多個雲端供應商的 GPU 資源。
  • 零設定執行:無需手動撰寫範本或設定檔即可啟動作業。
  • 彈性部署:支援 virtualenv、Docker、Kubernetes 與 SLURM。
  • 優先順序排程:支援優先順序佇列,確保關鍵任務優先執行。
  • 快速啟動:使用自包含的 Bootstrap 系統,使代理啟動速度最快提升 10 倍。
  • 服務模式:可啟動長期執行的服務容器,用於自動擴展、控制器或最佳化器。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案