ggml-org/llama.cpp
LLM inference in C/C++
llama.cpp – 純 C/C++ 的高速 LLM 推論
它是什麼 – llama.cpp 是一套函式庫與命令列工具,可在本機執行大型語言模型(LLM)。它以純 C/C++ 撰寫,沒有外部執行時相依,支援各式 CPU 與 GPU(Apple Metal、x86 AVX/AVX2/AVX‑512/AMX、RISC‑V 擴充、CUDA、Vulkan、SYCL 等)。目標是在提供最先進的推論效能同時,讓設定盡可能簡單。
主要特性
- 支援 GGML/GGUF 模型格式,並能將模型量化至 1.5‑8 位元整數,以降低記憶體需求與加速推論。
- 可在筆記型電腦(Apple Silicon、x86、RISC‑V)到雲端 GPU(NVIDIA、AMD、Intel、Moore Threads、Ascend)甚至透過 WebGPU 的瀏覽器上執行。
- 提供輕量 CLI(
llama-cli)直接提示、相容 REST 的伺服器(llama‑server)模仿 OpenAI API,以及 C 函式庫(libllama)供其他程式嵌入引擎。 - 廣泛的模型支援:LLaMA 1‑3、LLaMA 2、Mistral、Mixtral、Falcon、Gemma、Yi、Qwen、眾多多語言與程式碼模型,另有持續增長的多模態視覺‑語言模型(LLaVA、BakLLaVA、Moondream 等)。
- 豐富的語言綁定生態系(Python、Go、Node、Rust、.NET、Java、Swift、Ruby 等)與 UI 前端(LMStudio、Ollama、Jan、KoboldCPP、LocalAI 等)。
快速上手
- 安裝 – 使用套件管理員(
brew、nix、winget、conda‑forge),或從 Release 頁面下載預建二進位檔,執行提供的 Docker 映像,或自行從原始碼編譯(請見docs/install.md與docs/build.md)。 - 取得模型 – 從 Hugging Face 下載 GGUF 模型(
llama-cli -hf <repo>/<model>-GGUF),或使用ggify等工具將自己的 PyTorch checkpoint 轉換。 - 執行提示
llama-cli -m my_model.gguf "Explain quantum computing in one sentence" - 啟動伺服器(相容 OpenAI‑style 客戶端):
任何 OpenAI 客戶端函式庫皆可作為前端使用此伺服器。llama-server -hf ggml-org/gemma-3-1b-it-GGUF
為何重要
- 讓使用者能在私有、離線環境下使用 LLM,無需龐大的框架。
- 降低硬體門檻:即使是一般 CPU 也能在 aggressive 量化下執行 4‑7 B 參數模型。
- 作為 GGML 生態系的參考實作,推動眾多下游專案(綁定、UI 應用、雲端原生 LLMOps 平台等)。
資源
- 文件 – 安裝、建置選項、後端細節、多模態支援、模型加入指南。
- 社群 – 討論新功能、套件化、WebUI 與合作(例如 NVIDIA MXFP4 支援)。
- 綁定與 UI 清單 – 精選的語言綁定與使用者介面列表,皆基於
llama.cpp。
以上資訊直接取自該儲存庫的 README。