ollama/ollama

Get up and running with Kimi-K2.6, GLM-5.2, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other models.

Ollama – 在本地執行開源大語言模型

是什麼 – Ollama 是一個跨平台執行環境,讓您能在自己的機器(macOS、Windows、Linux)或容器中下載、執行並與不斷增長的開源大型語言模型(LLMs)圖書館互動。它提供輕量級命令列介面(CLI)和簡單的 REST API,以及官方的 Python 與 JavaScript 客戶端程式庫。

為什麼重要 – 透過將模型推論保留在裝置上,Ollama 消除了對雲端 API 金鑰的需求,降低延遲,並讓您完全掌控資料隱私。它使用 llama.cpp 後端,在 CPU 上高效執行模型(在有 GPU 時亦可使用)。


快速入門

  1. 安裝 – 各作業系統的一行指令(或 Docker 映像):
    # macOS / Linux
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Windows (PowerShell)
    irm https://ollama.com/install.ps1 | iex
    
  2. 執行 CLI – 只需輸入 ollama。首次執行時會提示您拉取模型或連接整合。
  3. 執行模型 – 以 gemma4 模型為例:
    ollama run gemma4
    
    您將獲得一個互動式對話提示。
  4. 啟動整合 – 將 Ollama 變成程式碼助理、個人機器人,或連接其他工具的橋樑:
    ollama launch claude      # Claude Code 整合
    ollama launch openclaw   # 用於 Slack、Discord 等的 AI 助理
    

REST API(本機伺服器)

Ollama 在 http://localhost:11434 上啟動伺服器。典型的聊天請求如下:

POST /api/chat
{
  "model": "gemma4",
  "messages": [{"role": "user", "content": "為什麼天空是藍色的?"}],
  "stream": false
}

回應中包含 message.content 字段,其中是模型的回答。完整端點文件請見 https://docs.ollama.com/api。


語言綁定

語言 安裝指令 範例程式碼片段
Python pip install ollama from ollama import chat; chat(model='gemma4', messages=[{'role':'user','content':'為什麼天空是藍色的?'}])
JavaScript npm i ollama await ollama.chat({model:'gemma4', messages:[{role:'user',content:'為什麼天空是藍色的?'}]})
Go, Java, .NET, Ruby, Rust, R 等 – README 中列出的社群 SDK。

生態系統與整合

  • 模型圖書館 – 在 https://ollama.com/library 浏覽(例如:Gemma 4、Llama 3、Mistral)。模型按需拉取。
  • 整合 – 提供 Claude Code、Codex、GitHub Copilot 風格 CLI、DeepSeek、Droid、OpenCode 以及 OpenClaw 個人助理機器人的預先建構啟動指令。
  • 社群 UI 前端 – 多個開源 Web 與桌面客戶端(Open WebUI、Lobe Chat、AnythingLLM 等)連接到 Ollama API。
  • 框架支援 – 官方適配器支援 LangChain、LlamaIndex、Semantic Kernel、Spring AI、Haystack、AutoGPT、crewAI 等,輕鬆將 Ollama 模型嵌入 RAG 流程、自主代理或自訂應用中。
  • 可觀測性 – Opik、Langfuse、Lunary、OpenLIT、MLflow 等插件可監控延遲、令牌使用量與提示品質。
  • 部署 – Docker 映像(ollama/ollama)、Helm 圖表、Homebrew、Pacman、Nix、Guix,以及 GPU 支援主機的雲端教學(Google Cloud Run、Fly.io、Koyeb)用於擴展。

何時使用 Ollama

  • 本地開發 – 在不將資料傳送至外部 API 的情況下測試提示、原型化代理或建構私有工具。
  • 邊緣裝置 – 在筆電、桌面機或甚至 Android(透過社群 Android 伺服器)上執行,適用於網路受限環境。
  • 成本敏感的工作負載 – 透過使用免費的開源模型避免按令牌計費。
  • 隱私關鍵應用 – 將專屬文件保留在本地。

取得協助

總結 – Ollama 提供了一種簡單、統一的方式,在本地執行各種開源 LLM,透過穩定的 API 暴露它們,並整合至現代 AI 工具生態系統。

相關

  • Dispatch
  • Dispatch
  • 專案
  • 專案
  • Dispatch