docker/model-runner
Docker Model Runner
解决的问题
Docker Model Runner (DMR) 简化了 AI 模型的管理、执行和部署。它消除了手动配置推理环境的繁琐,允许开发者通过标准化的 CLI 直接从 Docker Hub 或其他符合 OCI 标准的注册表拉取并运行大型语言模型(LLM)。
工作原理
DMR 作为推理守护进程和 CLI 工具运行(集成于 Docker Desktop/Engine 中,或作为独立的 dmr 二进制文件使用)。它管理模型的生命周期——拉取、列出和运行它们,并提供 REST API 用于交互。系统集成了多个推理后端,包括 llama.cpp(支持 CPU、CUDA 和 ROCm 版本)和 vLLM,以处理实际的模型执行和 GPU 加速。
适用人群
希望在本地或生产环境中运行和提供 AI 模型,而无需处理手动环境设置、GPU 驱动配置或后端特定样板代码的开发者。
主要亮点
- 灵活安装:可作为 Docker 插件、Docker Desktop/Engine 的一部分,或无需安装 Docker 的独立二进制文件使用。
- 多后端支持:支持
llama.cpp和vLLM用于推理。 - 硬件加速:自动检测 GPU 并支持 NVIDIA(CUDA)和 AMD(ROCm)GPU。
- 标准化 API:提供 REST API 用于与模型聊天和管理模型生命周期。
- 编排能力:包含
dmrlet,一个专为无状态 AI 推理工作负载设计的编排器,可简化多 GPU 映射。
相关
- 项目
- 项目
- 项目
- 项目
- 项目