clearml/clearml
ClearML - Auto-Magical CI/CD to streamline your AI workload. Experiment Management, Data Management, Pipeline, Orchestration, Scheduling & Serving in one MLOps/LLMOps solution
What it solves
ClearML 旨在处理训练生产级深度学习模型时的“混乱过程”。它提供统一的工具套件,通过将实验追踪、MLOps 编排和数据管理整合到单一平台,简化 AI 工作流,降低保存研究成果并将模型投入生产的工作量。
How it works
ClearML 通过三个主要运行时组件工作:
- ClearML Python Package:一个 SDK,可在现有脚本中仅做极少代码修改(通常只需两行)即可自动记录参数、指标和环境细节。
- ClearML Server:集中式中心,存储实验、模型和工作流数据,并提供 Web UI 用于管理和自动化。
- ClearML Agent:编排工具,支持远程执行、可扩展性以及实验和工作流的可复现性。
Who it’s for
它面向使用机器学习和深度学习框架(如 PyTorch、TensorFlow、Keras、Scikit‑Learn)的研究人员和开发者,帮助他们协作、追踪实验并自动化训练流水线。
Highlights
- Automagical Experiment Tracking:自动捕获源码控制信息、超参数、stdout/stderr、资源监控(CPU/GPU)以及模型快照。
- MLOps/LLMOps Orchestration:支持在 Kubernetes、云端或裸金属上远程执行任务,并提供 AWS Auto‑Scaler 用于 EC2 实例的自动伸缩。
- Differentiable Data Management:为存放在 S3、GS、Azure 或 NAS 等对象存储上的数据集提供版本控制解决方案。
- Model Serving:提供可扩展的模型端点部署方案,支持 Nvidia‑Triton GPU 推理并内置监控。
- Hyper‑Parameter Optimization:集成贝叶斯优化算法,用于黑箱代码的参数优化。
- Fractional GPUs:基于容器的驱动层 GPU 内存限制,提高资源利用率。