ollama/ollama
Get up and running with Kimi-K2.6, GLM-5.2, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other models.
Ollama – 本地运行开源大语言模型
是什么 – Ollama 是一个跨平台运行时,允许您在自己的机器(macOS、Windows、Linux)或容器中下载、运行并交互式使用不断增长的开源大语言模型(LLMs)库。它提供轻量级命令行界面(CLI)和简单的 REST API,以及官方的 Python 和 JavaScript 客户端库。
为何重要 – 通过将模型推理保留在本地设备上,Ollama 消除了对云 API 密钥的需求,降低了延迟,并让您完全掌控数据隐私。它使用 llama.cpp 后端,在 CPU 上高效运行模型(在有 GPU 时也可利用 GPU)。
快速开始
- 安装 – 各操作系统的一行脚本(或 Docker 镜像):
# macOS / Linux curl -fsSL https://ollama.com/install.sh | sh # Windows (PowerShell) irm https://ollama.com/install.ps1 | iex - 运行 CLI – 只需输入
ollama。首次运行时会提示您拉取模型或连接集成。 - 运行模型 – 以
gemma4模型为例:
您将获得一个交互式聊天提示。ollama run gemma4 - 启动集成 – 将 Ollama 变为编码助手、个人机器人或连接其他工具的桥梁:
ollama launch claude # Claude Code 集成 ollama launch openclaw # 用于 Slack、Discord 等的 AI 助手
REST API(本地服务器)
Ollama 在 http://localhost:11434 上启动服务器。典型的聊天请求如下:
POST /api/chat
{
"model": "gemma4",
"messages": [{"role": "user", "content": "为什么天空是蓝色的?"}],
"stream": false
}
响应中包含 message.content 字段,其中是模型的回答。完整端点文档请见 https://docs.ollama.com/api。
语言绑定
| 语言 | 安装命令 | 示例代码片段 |
|---|---|---|
| Python | pip install ollama |
from ollama import chat; chat(model='gemma4', messages=[{'role':'user','content':'为什么天空是蓝色的?'}]) |
| JavaScript | npm i ollama |
await ollama.chat({model:'gemma4', messages:[{role:'user',content:'为什么天空是蓝色的?'}]}) |
| Go, Java, .NET, Ruby, Rust, R 等 – README 中列出的社区 SDK。 |
生态系统与集成
- 模型库 – 在 https://ollama.com/library 浏览(例如:Gemma 4、Llama 3、Mistral)。模型按需拉取。
- 集成 – 提供 Claude Code、Codex、GitHub Copilot 风格 CLI、DeepSeek、Droid、OpenCode 以及 OpenClaw 个人助手机器人的预构建启动命令。
- 社区 UI 前端 – 多个开源 Web 和桌面客户端(Open WebUI、Lobe Chat、AnythingLLM 等)连接到 Ollama API。
- 框架支持 – 官方适配器支持 LangChain、LlamaIndex、Semantic Kernel、Spring AI、Haystack、AutoGPT、crewAI 等,轻松将 Ollama 模型嵌入 RAG 流水线、自主代理或自定义应用中。
- 可观测性 – Opik、Langfuse、Lunary、OpenLIT、MLflow 等插件可监控延迟、令牌使用量和提示质量。
- 部署 – Docker 镜像(
ollama/ollama)、Helm 图表、Homebrew、Pacman、Nix、Guix,以及 GPU 支持主机的云教程(Google Cloud Run、Fly.io、Koyeb)用于扩展。
何时使用 Ollama
- 本地开发 – 在不发送数据到外部 API 的情况下测试提示、原型化代理或构建私有工具。
- 边缘设备 – 在笔记本电脑、台式机甚至 Android(通过社区 Android 服务器)上运行,适用于网络受限环境。
- 成本敏感型工作负载 – 通过使用免费的开源模型避免按令牌计费。
- 隐私关键型应用 – 将专有文档保留在本地。
获取帮助
- 文档 – https://docs.ollama.com(CLI、API、模型导入、从源码构建)
- 社区 – Discord、X(Twitter)、Reddit,以及不断增长的第三方集成列表。
总结 – Ollama 提供了一种简单、统一的方式,在本地运行各种开源 LLM,通过稳定 API 暴露它们,并将其集成到现代 AI 工具生态系统中。
相关
- Dispatch
- Dispatch
- 项目
- 项目
- Dispatch