clearml/clearml-agent
ClearML Agent - MLOps/LLMOps made easy. MLOps/LLMOps scheduler & orchestration solution
What it solves
ClearML Agent 解决了 MLOps 和 LLMOps 的复杂性,通过提供零配置的编排和调度解决方案。它消除了在本地和云端 GPU/CPU 混合集群中运行机器学习实验时对手动环境设置、YAML/JSON 配置或深厚 DevOps 知识的需求。
How it works
The agent 作为一个任务调度器,监听 ClearML Server 上的特定队列。当通过 UI 或 API 将实验放入队列时,agent 会:
- 创建虚拟环境或启动指定的 Docker 容器。
- 从 Git 仓库克隆所需的代码。
- 安装必要的 Python 包(根据机器的 CUDA 版本自动选择 PyTorch 版本)。
- 执行代码并监控其进度,将所有输出 (stdout/stderr) 记录回 ClearML UI。
它可以运行在裸机、虚拟机或 Kubernetes 中(包括一种将 ClearML 任务映射到 K8s 任务的 "Glue mode")。此外,还提供 "Bootstrap" 系统,通过为 Python、Git 和 UV 提供预编译二进制文件来加速冷启动。
Who it’s for
它是为 ML 研究人员和工程师设计的,他们需要将实验从单机扩展到动态集群,而无需在基础设施管理或容器编排方面花费大量时间。
Highlights
- Hybrid Resource Management: 结合本地和多个云提供商的 GPU 资源。
- Zero-Config Execution: 无需手动模板或配置文件来启动任务。
- Flexible Deployment: 支持 virtualenv、Docker、Kubernetes 和 SLURM。
- Priority Scheduling: 支持优先级队列,以确保关键任务优先执行。
- Rapid Bootstrapping: 使用自包含的 bootstrap 系统,启动 agent 的速度可提升高达 10 倍。
- Services Mode: 能够启动用于自动扩缩容、控制器或优化器的长期运行的服务容器。
相关
- 项目
- 项目
- 项目
- 项目
- 项目