ggml-org/llama.cpp

LLM inference in C/C++

llama.cpp – 纯 C/C++ 的高速 LLM 推理

它是什么llama.cpp 是一个库和一套命令行工具,可在本地运行大型语言模型(LLM)。它使用纯 C/C++ 编写,没有外部运行时依赖,支持各种 CPU 与 GPU(Apple Metal、x86 AVX/AVX2/AVX‑512/AMX、RISC‑V 扩展、CUDA、Vulkan、SYCL 等)。目标是在提供最先进的推理性能的同时,使设置尽可能简单。

关键特性

  • 支持 GGML/​GGUF 模型格式,并能将模型量化至 1.5‑8 位整数,以降低内存占用并加速推理。
  • 可在笔记本电脑(Apple Silicon、x86、RISC‑V)到云端 GPU(NVIDIA、AMD、Intel、Moore Threads、Ascend)甚至通过 WebGPU 的浏览器上运行。
  • 提供轻量 CLI(llama-cli)直接提示、兼容 REST 的服务器(llama‑server)模拟 OpenAI API,以及 C 库(libllama)供其他程序嵌入引擎。
  • 广泛的模型支持:LLaMA 1‑3、LLaMA 2、Mistral、Mixtral、Falcon、Gemma、Yi、Qwen、众多多语言和代码模型,以及不断增长的多模态视觉‑语言模型(LLaVA、BakLLaVA、Moondream 等)。
  • 丰富的语言绑定生态(Python、Go、Node、Rust、.NET、Java、Swift、Ruby 等)和 UI 前端(LMStudio、Ollama、Jan、KoboldCPP、LocalAI 等)。

快速入门

  1. 安装 – 使用包管理器(brewnixwingetconda‑forge),或从 Release 页面下载预构建二进制文件,运行提供的 Docker 镜像,或自行从源码编译(请参见 docs/install.mddocs/build.md)。
  2. 获取模型 – 从 Hugging Face 下载 GGUF 模型(llama-cli -hf <repo>/<model>-GGUF),或使用 ggify 等工具将自己的 PyTorch checkpoint 转换。
  3. 运行提示
    llama-cli -m my_model.gguf "Explain quantum computing in one sentence"
    
  4. 启动服务器(兼容 OpenAI‑style 客户端):
    llama-server -hf ggml-org/gemma-3-1b-it-GGUF
    
    任何 OpenAI 客户端库都可以作为前端使用此服务器。

为何重要

  • 让用户能够在私有、离线环境下使用 LLM,无需庞大的框架。
  • 降低硬件门槛:即使是普通 CPU 也能在激进量化下运行 4‑7 B 参数模型。
  • 作为 GGML 生态的参考实现,推动众多下游项目(绑定、UI 应用、云原生 LLMOps 平台等)。

资源

  • 文档 – 安装、构建选项、后端细节、多模态支持、模型添加指南。
  • 社区 – 讨论新功能、打包、WebUI 与合作(例如 NVIDIA MXFP4 支持)。
  • 绑定与 UI 列表 – 精选的语言绑定和用户界面列表,全部基于 llama.cpp

以上信息直接取自仓库的 README。