ollama/ollama

Get up and running with Kimi-K2.6, GLM-5.2, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other models.

Ollama – 로컬에서 오픈소스 LLM 실행하기

무엇인가요 – Ollama는 macOS, Windows, Linux에서 자신의 머신 또는 컨테이너에서 점점 늘어나는 오픈소스 대규모 언어 모델(LLM) 라이브러리를 다운로드하고 실행하며 상호작용할 수 있는 크로스플랫폼 런타임입니다. 가벼운 명령줄 인터페이스(CLI)와 간단한 REST API를 제공하며, 공식 Python 및 JavaScript 클라이언트 라이브러리도 포함합니다.

왜 중요한가요 – 모델 추론을 장치 내에서 수행함으로써 Ollama는 클라우드 API 키가 필요 없으며, 지연 시간을 줄이고 데이터 프라이버시에 대한 완전한 통제를 제공합니다. llama.cpp 백엔드를 사용하여 CPU(가용 시 GPU)에서 모델을 효율적으로 실행합니다.


빠른 시작

  1. 설치 – 각 OS용 원라인 스크립트(또는 Docker 이미지):
    # macOS / Linux
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Windows (PowerShell)
    irm https://ollama.com/install.ps1 | iex
    
  2. CLI 실행ollama만 입력하면 됩니다. 첫 실행 시 모델을 다운로드하거나 통합에 연결하라는 메시지가 표시됩니다.
  3. 모델 실행gemma4 모델 예시:
    ollama run gemma4
    
    상호작용 가능한 채팅 프롬프트가 나타납니다.
  4. 통합 실행 – Ollama를 코딩 어시스턴트, 개인 봇, 또는 다른 도구로 연결하는 데 사용할 수 있습니다:
    ollama launch claude      # Claude Code 통합
    ollama launch openclaw   # Slack, Discord 등용 AI 어시스턴트
    

REST API (로컬 서버)

Ollama는 http://localhost:11434에서 서버를 시작합니다. 일반적인 채팅 요청은 다음과 같습니다:

POST /api/chat
{
  "model": "gemma4",
  "messages": [{"role": "user", "content": "하늘은 왜 파란가요?"}],
  "stream": false
}

응답에는 message.content 필드에 모델의 답변이 포함됩니다. 전체 엔드포인트 문서는 https://docs.ollama.com/api 에 있습니다.


언어 바인딩

언어 설치 명령어 예제 스니펫
Python pip install ollama from ollama import chat; chat(model='gemma4', messages=[{'role':'user','content':'하늘은 왜 파란가요?'}])
JavaScript npm i ollama await ollama.chat({model:'gemma4', messages:[{role:'user',content:'하늘은 왜 파란가요?'}]})
Go, Java, .NET, Ruby, Rust, R 등 – README에 나열된 커뮤니티 SDK.

생태계 및 통합

  • 모델 라이브러리https://ollama.com/library 에서 둘러보기 (예: Gemma 4, Llama 3, Mistral). 모델은 필요할 때마다 다운로드됩니다.
  • 통합 – Claude Code, Codex, GitHub Copilot 스타일 CLI, DeepSeek, Droid, OpenCode, OpenClaw 개인 어시스턴트 봇 등에 대한 사전 구축된 실행 명령어 제공.
  • 커뮤니티 UI 프론트엔드 – Ollama API에 연결하는 수많은 오픈소스 웹 및 데스크톱 클라이언트(Open WebUI, Lobe Chat, AnythingLLM 등).
  • 프레임워크 지원 – LangChain, LlamaIndex, Semantic Kernel, Spring AI, Haystack, AutoGPT, crewAI 등 공식 어댑터 제공으로 RAG 파이프라인, 자율 에이전트, 또는 커스텀 애플리케이션에 Ollama 모델을 쉽게 통합할 수 있습니다.
  • 관측성 – Opik, Langfuse, Lunary, OpenLIT, MLflow 등의 플러그인을 통해 지연 시간, 토큰 사용량, 프롬프트 품질을 모니터링할 수 있습니다.
  • 배포 – Docker 이미지(ollama/ollama), Helm 차트, Homebrew, Pacman, Nix, Guix, 그리고 GPU 지원 호스트에서 확장하기 위한 클라우드 튜토리얼(Google Cloud Run, Fly.io, Koyeb).

Ollama를 사용할 때

  • 로컬 개발 – 외부 API로 데이터를 전송하지 않고 프롬프트 테스트, 에이전트 프로토타이핑, 사내 도구 개발.
  • 에지 디바이스 – 인터넷 연결이 제한된 노트북, 데스크톱, 또는 커뮤니티 Android 서버를 통해 Android에서도 실행 가능.
  • 비용 민감한 워크로드 – 무료 오픈소스 모델을 사용해 토큰당 요금을 피할 수 있음.
  • 프라이버시가 중요한 애플리케이션 – 기업 문서를 온프레미스에 보관.

도움 받기

  • 문서https://docs.ollama.com (CLI, API, 모델 임포트, 소스에서 빌드)
  • 커뮤니티 – Discord, X(Twitter), Reddit, 그리고 증가하는 제3자 통합 목록.

결론 – Ollama는 다양한 오픈소스 LLM을 로컬에서 실행하고, 안정적인 API를 통해 노출하며, 현대 AI 도구 생태계에 쉽게 통합할 수 있는 간단하고 통합된 방법을 제공합니다.

관련

  • Dispatch
  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch