docker/model-runner
Docker Model Runner
何を解決するか
Docker Model Runner (DMR) は、AIモデルの管理、実行、デプロイを簡素化します。開発者が手動で推論環境を設定する煩わしさを排除し、標準化されたCLIを使ってDocker Hubやその他のOCI準拠レジストリから大規模言語モデル(LLM)を直接プルして実行できるようにします。
動作方法
DMRは推論デーモンおよびCLIツールとして動作し(Docker Desktop/Engineに統合されているか、スタンドアロンの dmr バイナリとして利用可能)、モデルのライフサイクル(プル、一覧表示、実行)を管理し、REST APIを提供して相互作用します。複数の推論バックエンド(llama.cpp(CPU、CUDA、ROCm対応)および vLLM)を統合しており、実際のモデル実行とGPU加速を処理します。
対象ユーザー
手動での環境設定、GPUドライバーの設定、バックエンド固有のボイラープレートに悩まずに、ローカルまたは本番環境でAIモデルを実行・提供したい開発者。
特徴
- 柔軟なインストール: Dockerプラグイン、Docker Desktop/Engineの一部、またはDockerインストール不要のスタンドアロンバイナリとして利用可能。
- 複数のバックエンド: 推論に
llama.cppとvLLMをサポート。 - ハードウェアアクセラレーション: NVIDIA(CUDA)およびAMD(ROCm)GPUの自動検出とサポート。
- 標準化されたAPI: モデルとのチャットやモデルライフサイクル管理に使えるREST APIを公開。
- オーケストレーション: 状態なしAI推論ワークロード向けの専用オーケストレータ
dmrletを含み、マルチGPUマッピングを簡素化。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト