ollama/ollama

Get up and running with Kimi-K2.6, GLM-5.2, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other models.

Ollama – 本地运行开源大语言模型

是什么 – Ollama 是一个跨平台运行时,允许您在自己的机器(macOS、Windows、Linux)或容器中下载、运行并交互式使用不断增长的开源大语言模型(LLMs)库。它提供轻量级命令行界面(CLI)和简单的 REST API,以及官方的 Python 和 JavaScript 客户端库。

为何重要 – 通过将模型推理保留在本地设备上,Ollama 消除了对云 API 密钥的需求,降低了延迟,并让您完全掌控数据隐私。它使用 llama.cpp 后端,在 CPU 上高效运行模型(在有 GPU 时也可利用 GPU)。


快速开始

  1. 安装 – 各操作系统的一行脚本(或 Docker 镜像):
    # macOS / Linux
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Windows (PowerShell)
    irm https://ollama.com/install.ps1 | iex
    
  2. 运行 CLI – 只需输入 ollama。首次运行时会提示您拉取模型或连接集成。
  3. 运行模型 – 以 gemma4 模型为例:
    ollama run gemma4
    
    您将获得一个交互式聊天提示。
  4. 启动集成 – 将 Ollama 变为编码助手、个人机器人或连接其他工具的桥梁:
    ollama launch claude      # Claude Code 集成
    ollama launch openclaw   # 用于 Slack、Discord 等的 AI 助手
    

REST API(本地服务器)

Ollama 在 http://localhost:11434 上启动服务器。典型的聊天请求如下:

POST /api/chat
{
  "model": "gemma4",
  "messages": [{"role": "user", "content": "为什么天空是蓝色的?"}],
  "stream": false
}

响应中包含 message.content 字段,其中是模型的回答。完整端点文档请见 https://docs.ollama.com/api。


语言绑定

语言 安装命令 示例代码片段
Python pip install ollama from ollama import chat; chat(model='gemma4', messages=[{'role':'user','content':'为什么天空是蓝色的?'}])
JavaScript npm i ollama await ollama.chat({model:'gemma4', messages:[{role:'user',content:'为什么天空是蓝色的?'}]})
Go, Java, .NET, Ruby, Rust, R 等 – README 中列出的社区 SDK。

生态系统与集成

  • 模型库 – 在 https://ollama.com/library 浏览(例如:Gemma 4、Llama 3、Mistral)。模型按需拉取。
  • 集成 – 提供 Claude Code、Codex、GitHub Copilot 风格 CLI、DeepSeek、Droid、OpenCode 以及 OpenClaw 个人助手机器人的预构建启动命令。
  • 社区 UI 前端 – 多个开源 Web 和桌面客户端(Open WebUI、Lobe Chat、AnythingLLM 等)连接到 Ollama API。
  • 框架支持 – 官方适配器支持 LangChain、LlamaIndex、Semantic Kernel、Spring AI、Haystack、AutoGPT、crewAI 等,轻松将 Ollama 模型嵌入 RAG 流水线、自主代理或自定义应用中。
  • 可观测性 – Opik、Langfuse、Lunary、OpenLIT、MLflow 等插件可监控延迟、令牌使用量和提示质量。
  • 部署 – Docker 镜像(ollama/ollama)、Helm 图表、Homebrew、Pacman、Nix、Guix,以及 GPU 支持主机的云教程(Google Cloud Run、Fly.io、Koyeb)用于扩展。

何时使用 Ollama

  • 本地开发 – 在不发送数据到外部 API 的情况下测试提示、原型化代理或构建私有工具。
  • 边缘设备 – 在笔记本电脑、台式机甚至 Android(通过社区 Android 服务器)上运行,适用于网络受限环境。
  • 成本敏感型工作负载 – 通过使用免费的开源模型避免按令牌计费。
  • 隐私关键型应用 – 将专有文档保留在本地。

获取帮助

总结 – Ollama 提供了一种简单、统一的方式,在本地运行各种开源 LLM,通过稳定 API 暴露它们,并将其集成到现代 AI 工具生态系统中。

相关

  • Dispatch
  • Dispatch
  • 项目
  • 项目
  • Dispatch