Ollama 공식 Docker 이미지 출시

Ollama는 이제 공식적으로 Docker의 후원을 받는 오픈 소스 이미지로 제공되어, 사용자가 대규모 언어 모델(LLM)을 Docker 컨테이너 내에서 로컬로 실행할 수 있게 함으로써 개인 데이터가 제3자 서비스로 전송되지 않고 로컬 머신에 머물도록 보장합니다.

GPU 가속 및 플랫폼 지원

Ollama는 애플리케이션 상호작용을 위한 CLI 및 REST API를 제공하며, 하드웨어 가속 지원은 플랫폼에 따라 다릅니다:

Linux

Linux에서 Ollama는 Docker 컨테이너 내에서 특히 Nvidia GPU에 대한 GPU 가속을 지원합니다. 이를 활성화하려면 사용자가 컨테이너를 --gpus=all 플래그와 함께 실행하기 전에 Nvidia container toolkit을 설치해야 합니다.

macOS

macOS에서 사용자는 Ollama를 Docker 컨테이너 외부의 독립형 애플리케이션으로 실행해야 합니다. 이는 Docker Desktop이 현재 최적의 모델 성능에 필요한 GPU 가속을 지원하지 않기 때문입니다.

배포 및 구성

Ollama는 사용 가능한 하드웨어에 따라 다양한 구성으로 Docker를 통해 배포될 수 있습니다:

CPU 전용 배포

CPU만 사용하여 Ollama를 실행하려면 다음 명령어를 사용하십시오:

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

Nvidia GPU 배포

Nvidia container toolkit을 설치한 후, GPU 가속을 활성화하려면 다음 명령어를 사용하십시오:

docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

컨테이너 내에서 모델 실행하기

Ollama 컨테이너가 활성화되면, 사용자는 docker exec 명령어를 사용하여 컨테이너 내에서 Llama 2와 같은 모델을 직접 실행할 수 있습니다:

docker exec -it ollama ollama run llama2

추가 모델은 Ollama 라이브러리를 통해 사용할 수 있습니다.

Sources

관련

  • 프로젝트
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch