clearml/clearml
ClearML - Auto-Magical CI/CD to streamline your AI workload. Experiment Management, Data Management, Pipeline, Orchestration, Scheduling & Serving in one MLOps/LLMOps solution
What it solves
ClearML은 프로덕션 급 딥러닝 모델을 학습할 때 발생하는 "복잡한 프로세스"를 처리하도록 설계되었습니다. 실험 추적, MLOps 오케스트레이션, 데이터 관리를 하나의 플랫폼에 통합한 통합 툴 세트를 제공하여 AI 워크플로를 간소화하고, 연구 결과를 보존하고 모델을 프로덕션에 옮기는 데 필요한 노력을 줄여줍니다.
How it works
ClearML은 세 가지 주요 런타임 구성 요소를 통해 작동합니다:
- ClearML Python Package: 기존 스크립트에 최소한의 코드 변경(대부분 두 줄)만으로 통합할 수 있는 SDK로, 파라미터, 메트릭, 환경 정보를 자동으로 기록합니다.
- ClearML Server: 실험, 모델, 워크플로 데이터를 저장하는 중앙 허브이며, 관리와 자동화를 위한 Web UI를 제공합니다.
- ClearML Agent: 원격 실행, 확장성, 실험 및 워크플로의 재현성을 가능하게 하는 오케스트레이션 도구입니다.
Who it’s for
PyTorch, TensorFlow, Keras, Scikit‑Learn 등 머신러닝·딥러닝 프레임워크를 사용하는 연구자와 개발자를 위해 설계되었으며, 협업, 실험 추적 및 학습 파이프라인 자동화가 필요한 경우에 적합합니다.
Highlights
- Automagical Experiment Tracking: 소스 컨트롤 정보, 하이퍼파라미터, stdout/stderr, 리소스 모니터링(CPU/GPU), 모델 스냅샷을 자동으로 캡처합니다.
- MLOps/LLMOps Orchestration: Kubernetes, 클라우드, 베어메탈에서 작업을 원격 실행할 수 있으며, EC2 인스턴스를 위한 AWS Auto‑Scaler를 포함합니다.
- Differentiable Data Management: S3, GS, Azure, NAS와 같은 객체 스토리지에 저장된 데이터셋에 대한 버전 관리 솔루션을 제공합니다.
- Model Serving: Nvidia‑Triton을 통한 GPU 지원 모델 엔드포인트를 확장 가능하게 배포하고, 내장 모니터링을 제공합니다.
- Hyper‑Parameter Optimization: 블랙박스 코드 최적화를 위한 베이지안 최적화 알고리즘을 통합했습니다.
- Fractional GPUs: 컨테이너 기반 드라이버 레벨에서 GPU 메모리를 제한하여 자원 활용도를 높입니다.