clearml/clearml

ClearML - Auto-Magical CI/CD to streamline your AI workload. Experiment Management, Data Management, Pipeline, Orchestration, Scheduling & Serving in one MLOps/LLMOps solution

What it solves

ClearML 旨在處理訓練生產等級深度學習模型時的「雜亂流程」。它提供一套整合的工具,透過將實驗追蹤、MLOps 編排與資料管理整合於同一平台,簡化 AI 工作流程,減少保存研究成果與將模型推向生產所需的工作量。

How it works

ClearML 透過三個主要的執行時元件運作:

  • ClearML Python Package:一個 SDK,可在現有腳本中僅加入極少程式碼(通常只需兩行)即自動記錄參數、指標與環境資訊。
  • ClearML Server:集中式中心,儲存實驗、模型與工作流程資料,並提供 Web UI 供管理與自動化使用。
  • ClearML Agent:編排工具,支援遠端執行、可擴展性與實驗與工作流程的可重現性。

Who it’s for

此套件適用於使用機器學習與深度學習框架(如 PyTorch、TensorFlow、Keras、Scikit‑Learn)的研究人員與開發者,需協作、追蹤實驗並自動化訓練管線。

Highlights

  • Automagical Experiment Tracking:自動捕捉版本控制資訊、超參數、stdout/stderr、資源監控(CPU/GPU)與模型快照。
  • MLOps/LLMOps Orchestration:支援在 Kubernetes、雲端或裸機上遠端執行任務,並提供 AWS Auto‑Scaler 以自動調整 EC2 實例。
  • Differentiable Data Management:針對存放於 S3、GS、Azure 或 NAS 等物件儲存的資料集提供版本控制解決方案。
  • Model Serving:提供可擴展的模型端點部署方案,支援 Nvidia‑Triton GPU 推論與內建監控。
  • Hyper‑Parameter Optimization:內建貝葉斯最佳化演算法,用於黑箱程式碼的參數優化。
  • Fractional GPUs:基於容器的驅動層 GPU 記憶體限制,提升資源利用率。