clearml/clearml

ClearML - Auto-Magical CI/CD to streamline your AI workload. Experiment Management, Data Management, Pipeline, Orchestration, Scheduling & Serving in one MLOps/LLMOps solution

What it solves

ClearML 旨在处理训练生产级深度学习模型时的“混乱过程”。它提供统一的工具套件,通过将实验追踪、MLOps 编排和数据管理整合到单一平台,简化 AI 工作流,降低保存研究成果并将模型投入生产的工作量。

How it works

ClearML 通过三个主要运行时组件工作:

  • ClearML Python Package:一个 SDK,可在现有脚本中仅做极少代码修改(通常只需两行)即可自动记录参数、指标和环境细节。
  • ClearML Server:集中式中心,存储实验、模型和工作流数据,并提供 Web UI 用于管理和自动化。
  • ClearML Agent:编排工具,支持远程执行、可扩展性以及实验和工作流的可复现性。

Who it’s for

它面向使用机器学习和深度学习框架(如 PyTorch、TensorFlow、Keras、Scikit‑Learn)的研究人员和开发者,帮助他们协作、追踪实验并自动化训练流水线。

Highlights

  • Automagical Experiment Tracking:自动捕获源码控制信息、超参数、stdout/stderr、资源监控(CPU/GPU)以及模型快照。
  • MLOps/LLMOps Orchestration:支持在 Kubernetes、云端或裸金属上远程执行任务,并提供 AWS Auto‑Scaler 用于 EC2 实例的自动伸缩。
  • Differentiable Data Management:为存放在 S3、GS、Azure 或 NAS 等对象存储上的数据集提供版本控制解决方案。
  • Model Serving:提供可扩展的模型端点部署方案,支持 Nvidia‑Triton GPU 推理并内置监控。
  • Hyper‑Parameter Optimization:集成贝叶斯优化算法,用于黑箱代码的参数优化。
  • Fractional GPUs:基于容器的驱动层 GPU 内存限制,提高资源利用率。