docker/model-runner
Docker Model Runner
解決的問題
Docker Model Runner (DMR) 簡化了 AI 模型的管理、執行與部署。它消除了手動設定推論環境的繁瑣,讓開發者能透過標準化的 CLI 直接從 Docker Hub 或其他符合 OCI 標準的註冊表拉取並執行大型語言模型(LLM)。
工作原理
DMR 作為推論守護程序與 CLI 工具運作(整合於 Docker Desktop/Engine 中,或作為獨立的 dmr 二進位檔使用)。它管理模型的生命周期——拉取、列出與執行,並提供 REST API 供互動。系統整合多個推論後端,包括 llama.cpp(支援 CPU、CUDA 與 ROCm 版本)與 vLLM,以處理實際的模型執行與 GPU 加速。
適用對象
希望在本地或生產環境中執行與提供 AI 模型,而無需處理手動環境設定、GPU 驅動程式配置或後端特定樣板程式碼的開發者。
主要特色
- 彈性安裝:可作為 Docker 插件、Docker Desktop/Engine 的一部分,或無需安裝 Docker 的獨立二進位檔使用。
- 多後端支援:支援
llama.cpp與vLLM用於推論。 - 硬體加速:自動偵測 GPU 並支援 NVIDIA(CUDA)與 AMD(ROCm)GPU。
- 標準化 API:提供 REST API 用於與模型對話與管理模型生命週期。
- 編排功能:包含
dmrlet,一個專為無狀態 AI 推論工作負載設計的編排器,可簡化多 GPU 映射。
相關
- 專案
- 專案
- 專案
- 專案
- 專案