docker/model-runner

Docker Model Runner

何を解決するか

Docker Model Runner (DMR) は、AIモデルの管理、実行、デプロイを簡素化します。開発者が手動で推論環境を設定する煩わしさを排除し、標準化されたCLIを使ってDocker Hubやその他のOCI準拠レジストリから大規模言語モデル(LLM)を直接プルして実行できるようにします。

動作方法

DMRは推論デーモンおよびCLIツールとして動作し(Docker Desktop/Engineに統合されているか、スタンドアロンの dmr バイナリとして利用可能)、モデルのライフサイクル(プル、一覧表示、実行)を管理し、REST APIを提供して相互作用します。複数の推論バックエンド(llama.cpp(CPU、CUDA、ROCm対応)および vLLM)を統合しており、実際のモデル実行とGPU加速を処理します。

対象ユーザー

手動での環境設定、GPUドライバーの設定、バックエンド固有のボイラープレートに悩まずに、ローカルまたは本番環境でAIモデルを実行・提供したい開発者。

特徴

  • 柔軟なインストール: Dockerプラグイン、Docker Desktop/Engineの一部、またはDockerインストール不要のスタンドアロンバイナリとして利用可能。
  • 複数のバックエンド: 推論に llama.cppvLLM をサポート。
  • ハードウェアアクセラレーション: NVIDIA(CUDA)およびAMD(ROCm)GPUの自動検出とサポート。
  • 標準化されたAPI: モデルとのチャットやモデルライフサイクル管理に使えるREST APIを公開。
  • オーケストレーション: 状態なしAI推論ワークロード向けの専用オーケストレータ dmrlet を含み、マルチGPUマッピングを簡素化。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト