docker/model-runner
Docker Model Runner
해결하는 문제
Docker Model Runner (DMR)는 AI 모델의 관리, 실행, 배포를 간소화합니다. 개발자가 수동으로 추론 환경을 설정하는 번거로움을 제거하고, 표준화된 CLI를 통해 Docker Hub나 기타 OCI 준수 레지스트리에서 대규모 언어 모델(LLM)을 직접 풀링하고 실행할 수 있게 합니다.
작동 방식
DMR는 추론 데몬 및 CLI 도구로 작동하며(Docker Desktop/Engine에 통합되거나, 독립형 dmr 바이너리로 사용 가능) 모델의 라이프사이클(다운로드, 목록 조회, 실행)을 관리하고 REST API를 제공하여 상호작용을 가능하게 합니다. 실제 모델 실행과 GPU 가속을 처리하기 위해 llama.cpp(CPU, CUDA, ROCm 버전 포함) 및 vLLM과 같은 여러 추론 백엔드를 통합합니다.
대상 사용자
수동 환경 설정, GPU 드라이버 설정, 백엔드별 보일러플레이트에 신경 쓰지 않고 로컬 또는 프로덕션 환경에서 AI 모델을 실행하고 제공하고 싶은 개발자들입니다.
주요 기능
- 유연한 설치: Docker 플러그인, Docker Desktop/Engine의 일부, 또는 Docker 설치 없이 사용 가능한 독립형 바이너리로 제공됩니다.
- 다중 백엔드 지원: 추론에
llama.cpp및vLLM을 지원합니다. - 하드웨어 가속: NVIDIA(CUDA) 및 AMD(ROCm) GPU의 자동 감지 및 지원을 제공합니다.
- 표준화된 API: 모델과 대화하고 모델 라이프사이클을 관리할 수 있는 REST API를 노출합니다.
- 오케스트레이션: 상태 없는 AI 추론 워크로드를 위한 전용 오케스트레이터
dmrlet을 포함하여 멀티 GPU 매핑을 간소화합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트