clearml/clearml-agent
ClearML Agent - MLOps/LLMOps made easy. MLOps/LLMOps scheduler & orchestration solution
해결하는 문제
ClearML Agent는 ML/DL 연구에서 DevOps 부담을 없애기 위해 설계된 작업 스케줄러 및 오케스트레이션 솔루션입니다. 연구자는 로컬이든 클라우드이든 환경을 수동으로 설정하거나 컨테이너를 관리하거나 복잡한 YAML/JSON 템플릿을 다루지 않고도 실험을 실행할 수 있습니다.
작동 방식
에이전트는 작업 큐를 청취하는 워커 역할을 합니다. ClearML UI를 통해 실험이 큐에 추가되면 에이전트가 작업을 가져와 자동으로 다음을 처리합니다.
- 환경 설정: 가상 환경을 만들거나 지정된 Docker 컨테이너를 실행합니다.
- 코드 가져오기: Git 저장소에서 필요한 코드를 클론합니다.
- 의존성 설치: 필요한 Python 패키지를 설치하고, 머신의 CUDA 버전에 맞춰 적절한 PyTorch 버전을 자동 선택합니다.
- 실행 및 모니터링: 코드를 실행하고 모든 출력(stdout/stderr)을 ClearML UI에 로그하여 원격 디버깅을 가능하게 합니다.
베어메탈, VM, Kubernetes 배포를 지원하며, Kubernetes용 "Glue mode"를 통해 ClearML 작업을 직접 K8s 작업에 매핑합니다.
대상 사용자
여러 GPU, 클라우드 인스턴스 또는 온프레미스 클러스터에 실험을 확장하고 싶지만 깊은 DevOps 전문 지식이 없는 머신러닝 엔지니어 및 연구자를 위한 도구입니다.
주요 특징
- Zero-Configuration: 템플릿 설정 없이 바로 실행할 수 있는 파이어‑앤‑포겟 방식.
- 유연한 리소스 관리: 클라우드와 온프레미스 하드웨어의 GPU 리소스를 결합하여 사용.
- 부트스트랩 지원: Python, Git, 에이전트의 사전 컴파일 바이너리를 제공해 콜드 스타트를 빠르게 하고 최소 컨테이너 이미지에서도 동작 가능.
- 멀티 플랫폼: Linux, macOS, Windows 지원.
- 오케스트레이션 기능: 우선순위 큐, 클라우드 자동 스케일링, 복잡한 실험 파이프라인 생성 지원.