ollama/ollama
Get up and running with Kimi-K2.6, GLM-5.2, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other models.
Ollama – 로컬에서 오픈소스 LLM 실행하기
무엇인가요 – Ollama는 macOS, Windows, Linux에서 자신의 머신 또는 컨테이너에서 점점 늘어나는 오픈소스 대규모 언어 모델(LLM) 라이브러리를 다운로드하고 실행하며 상호작용할 수 있는 크로스플랫폼 런타임입니다. 가벼운 명령줄 인터페이스(CLI)와 간단한 REST API를 제공하며, 공식 Python 및 JavaScript 클라이언트 라이브러리도 포함합니다.
왜 중요한가요 – 모델 추론을 장치 내에서 수행함으로써 Ollama는 클라우드 API 키가 필요 없으며, 지연 시간을 줄이고 데이터 프라이버시에 대한 완전한 통제를 제공합니다. llama.cpp 백엔드를 사용하여 CPU(가용 시 GPU)에서 모델을 효율적으로 실행합니다.
빠른 시작
- 설치 – 각 OS용 원라인 스크립트(또는 Docker 이미지):
# macOS / Linux curl -fsSL https://ollama.com/install.sh | sh # Windows (PowerShell) irm https://ollama.com/install.ps1 | iex - CLI 실행 –
ollama만 입력하면 됩니다. 첫 실행 시 모델을 다운로드하거나 통합에 연결하라는 메시지가 표시됩니다. - 모델 실행 –
gemma4모델 예시:
상호작용 가능한 채팅 프롬프트가 나타납니다.ollama run gemma4 - 통합 실행 – Ollama를 코딩 어시스턴트, 개인 봇, 또는 다른 도구로 연결하는 데 사용할 수 있습니다:
ollama launch claude # Claude Code 통합 ollama launch openclaw # Slack, Discord 등용 AI 어시스턴트
REST API (로컬 서버)
Ollama는 http://localhost:11434에서 서버를 시작합니다. 일반적인 채팅 요청은 다음과 같습니다:
POST /api/chat
{
"model": "gemma4",
"messages": [{"role": "user", "content": "하늘은 왜 파란가요?"}],
"stream": false
}
응답에는 message.content 필드에 모델의 답변이 포함됩니다. 전체 엔드포인트 문서는 https://docs.ollama.com/api 에 있습니다.
언어 바인딩
| 언어 | 설치 명령어 | 예제 스니펫 |
|---|---|---|
| Python | pip install ollama |
from ollama import chat; chat(model='gemma4', messages=[{'role':'user','content':'하늘은 왜 파란가요?'}]) |
| JavaScript | npm i ollama |
await ollama.chat({model:'gemma4', messages:[{role:'user',content:'하늘은 왜 파란가요?'}]}) |
| Go, Java, .NET, Ruby, Rust, R 등 – README에 나열된 커뮤니티 SDK. |
생태계 및 통합
- 모델 라이브러리 – https://ollama.com/library 에서 둘러보기 (예: Gemma 4, Llama 3, Mistral). 모델은 필요할 때마다 다운로드됩니다.
- 통합 – Claude Code, Codex, GitHub Copilot 스타일 CLI, DeepSeek, Droid, OpenCode, OpenClaw 개인 어시스턴트 봇 등에 대한 사전 구축된 실행 명령어 제공.
- 커뮤니티 UI 프론트엔드 – Ollama API에 연결하는 수많은 오픈소스 웹 및 데스크톱 클라이언트(Open WebUI, Lobe Chat, AnythingLLM 등).
- 프레임워크 지원 – LangChain, LlamaIndex, Semantic Kernel, Spring AI, Haystack, AutoGPT, crewAI 등 공식 어댑터 제공으로 RAG 파이프라인, 자율 에이전트, 또는 커스텀 애플리케이션에 Ollama 모델을 쉽게 통합할 수 있습니다.
- 관측성 – Opik, Langfuse, Lunary, OpenLIT, MLflow 등의 플러그인을 통해 지연 시간, 토큰 사용량, 프롬프트 품질을 모니터링할 수 있습니다.
- 배포 – Docker 이미지(
ollama/ollama), Helm 차트, Homebrew, Pacman, Nix, Guix, 그리고 GPU 지원 호스트에서 확장하기 위한 클라우드 튜토리얼(Google Cloud Run, Fly.io, Koyeb).
Ollama를 사용할 때
- 로컬 개발 – 외부 API로 데이터를 전송하지 않고 프롬프트 테스트, 에이전트 프로토타이핑, 사내 도구 개발.
- 에지 디바이스 – 인터넷 연결이 제한된 노트북, 데스크톱, 또는 커뮤니티 Android 서버를 통해 Android에서도 실행 가능.
- 비용 민감한 워크로드 – 무료 오픈소스 모델을 사용해 토큰당 요금을 피할 수 있음.
- 프라이버시가 중요한 애플리케이션 – 기업 문서를 온프레미스에 보관.
도움 받기
- 문서 – https://docs.ollama.com (CLI, API, 모델 임포트, 소스에서 빌드)
- 커뮤니티 – Discord, X(Twitter), Reddit, 그리고 증가하는 제3자 통합 목록.
결론 – Ollama는 다양한 오픈소스 LLM을 로컬에서 실행하고, 안정적인 API를 통해 노출하며, 현대 AI 도구 생태계에 쉽게 통합할 수 있는 간단하고 통합된 방법을 제공합니다.
관련
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트
- Dispatch