clearml/clearml

ClearML - Auto-Magical CI/CD to streamline your AI workload. Experiment Management, Data Management, Pipeline, Orchestration, Scheduling & Serving in one MLOps/LLMOps solution

What it solves

ClearML は、プロダクションレベルのディープラーニングモデルを訓練する際の「混沌としたプロセス」を扱うよう設計されています。実験トラッキング、MLOps オーケストレーション、データ管理を単一プラットフォームに統合した統合ツールスイートを提供し、AI ワークフローを簡素化し、研究成果の保存とモデルの本番移行に必要な労力を削減します。

How it works

ClearML は主に 3 つのランタイムコンポーネントで動作します:

  • ClearML Python Package:既存スクリプトに最小限のコード変更(多くの場合 2 行だけ)で組み込める SDK で、パラメータ、メトリクス、環境情報を自動的に記録します。
  • ClearML Server:実験、モデル、ワークフローのデータを保存する中央ハブで、管理と自動化のための Web UI を提供します。
  • ClearML Agent:リモート実行、スケーラビリティ、実験・ワークフローの再現性を可能にするオーケストレーションツールです。

Who it’s for

PyTorch、TensorFlow、Keras、Scikit‑Learn などの機械学習・ディープラーニングフレームワークを使用する研究者や開発者向けで、共同作業、実験の追跡、トレーニングパイプラインの自動化が必要な方に最適です。

Highlights

  • Automagical Experiment Tracking:ソースコントロール情報、ハイパーパラメータ、stdout/stderr、リソースモニタリング(CPU/GPU)、モデルスナップショットを自動で取得。
  • MLOps/LLMOps Orchestration:Kubernetes、クラウド、ベアメタル上でのタスクのリモート実行をサポートし、EC2 インスタンス用の AWS Auto‑Scaler も提供。
  • Differentiable Data Management:S3、GS、Azure、NAS などのオブジェクトストレージ上にあるデータセット向けのバージョン管理ソリューション。
  • Model Serving:Nvidia‑Triton を用いた GPU 対応のモデルエンドポイントをスケーラブルにデプロイし、組み込みモニタリングを提供。
  • Hyper‑Parameter Optimization:ブラックボックスコード最適化のためのベイズ最適化アルゴリズムを統合。
  • Fractional GPUs:コンテナベースのドライバーレベルで GPU メモリを制限し、リソース利用率を向上させます。