ggml-org/llama.cpp
LLM inference in C/C++
llama.cpp – 纯 C/C++ 的高速 LLM 推理
它是什么 – llama.cpp 是一个库和一套命令行工具,可在本地运行大型语言模型(LLM)。它使用纯 C/C++ 编写,没有外部运行时依赖,支持各种 CPU 与 GPU(Apple Metal、x86 AVX/AVX2/AVX‑512/AMX、RISC‑V 扩展、CUDA、Vulkan、SYCL 等)。目标是在提供最先进的推理性能的同时,使设置尽可能简单。
关键特性
- 支持 GGML/GGUF 模型格式,并能将模型量化至 1.5‑8 位整数,以降低内存占用并加速推理。
- 可在笔记本电脑(Apple Silicon、x86、RISC‑V)到云端 GPU(NVIDIA、AMD、Intel、Moore Threads、Ascend)甚至通过 WebGPU 的浏览器上运行。
- 提供轻量 CLI(
llama-cli)直接提示、兼容 REST 的服务器(llama‑server)模拟 OpenAI API,以及 C 库(libllama)供其他程序嵌入引擎。 - 广泛的模型支持:LLaMA 1‑3、LLaMA 2、Mistral、Mixtral、Falcon、Gemma、Yi、Qwen、众多多语言和代码模型,以及不断增长的多模态视觉‑语言模型(LLaVA、BakLLaVA、Moondream 等)。
- 丰富的语言绑定生态(Python、Go、Node、Rust、.NET、Java、Swift、Ruby 等)和 UI 前端(LMStudio、Ollama、Jan、KoboldCPP、LocalAI 等)。
快速入门
- 安装 – 使用包管理器(
brew、nix、winget、conda‑forge),或从 Release 页面下载预构建二进制文件,运行提供的 Docker 镜像,或自行从源码编译(请参见docs/install.md与docs/build.md)。 - 获取模型 – 从 Hugging Face 下载 GGUF 模型(
llama-cli -hf <repo>/<model>-GGUF),或使用ggify等工具将自己的 PyTorch checkpoint 转换。 - 运行提示
llama-cli -m my_model.gguf "Explain quantum computing in one sentence" - 启动服务器(兼容 OpenAI‑style 客户端):
任何 OpenAI 客户端库都可以作为前端使用此服务器。llama-server -hf ggml-org/gemma-3-1b-it-GGUF
为何重要
- 让用户能够在私有、离线环境下使用 LLM,无需庞大的框架。
- 降低硬件门槛:即使是普通 CPU 也能在激进量化下运行 4‑7 B 参数模型。
- 作为 GGML 生态的参考实现,推动众多下游项目(绑定、UI 应用、云原生 LLMOps 平台等)。
资源
- 文档 – 安装、构建选项、后端细节、多模态支持、模型添加指南。
- 社区 – 讨论新功能、打包、WebUI 与合作(例如 NVIDIA MXFP4 支持)。
- 绑定与 UI 列表 – 精选的语言绑定和用户界面列表,全部基于
llama.cpp。
以上信息直接取自仓库的 README。