Ollama 0.30 版本發佈,新增 GGUF 模型支援並提升 NVIDIA 效能高達 20%
TL;DR
Ollama 0.30 透過 llama.cpp 增加了原生 GGUF 模型支援,並將 NVIDIA GPU 吞吐量提升了高達 20%,同時預設啟用 Vulkan 以將 GPU 加速擴展到 AMD 和 Intel 硬體。
更快的 NVIDIA 吞吐量
由於 NVIDIA 和 llama.cpp 團隊所做的優化貢獻,Ollama 0.30 在 NVIDIA GPU 上的效能提升了高達 20%。所示的基準測試是在 RTX 5090 上使用量化為 Q4_K_M 的 Gemma 4 26B 模型,展示了更高的每秒 Token 速率。
在 NVIDIA RTX 5090 上使用 Q4_K_M 量化運行 Gemma 4 26B 模型進行測試。
預設啟用 Vulkan 以實現更廣泛的 GPU 相容性
Vulkan 現在已在 Ollama 中預設啟用,將 GPU 加速從 Apple silicon 擴展到 AMD 和 Intel 裝置。使用者不再需要安裝特定廠商的函式庫;模型可以在任何相容 Vulkan 的 GPU 上開箱即用。
透過 GGUF 擴展模型相容性
Ollama 0.30 透過 llama.cpp 整合了 GGUF 生態系統,允許更廣泛的模型集在無需自定義轉換步驟的情況下運行。支援的模型系列包括:
- LFM (例如, LiquidAI/LFM2-8B-A1B-GGUF)
- Prism (例如, prism-ml/Bonsai-8B-gguf)
- 來自 Unsloth 的微調模型
如何從 Hugging Face 運行 GGUF 模型
- 下載 GGUF 檔案或目錄。
- 建立一個指向 GGUF 路徑的
Modelfile:FROM ./my-model.Q4_K_M.gguf - 使用 Ollama 建立並運行模型:
ollama create -f Modelfile my-model ollama run my-model
工具呼叫能力得以保留
如果 GGUF 模型包含 tools 能力,Ollama 會保留工具呼叫支援,使其能夠與編碼代理 (coding agents) 和個人助理無縫使用。
範例啟動指令
- Claude Code:
ollama launch claude --model my-model - Hermes Agent:
ollama launch hermes --model my-model - OpenClaw:
ollama launch openclaw --model my-model
若要確認工具支援,請運行:
ollama show my-model
輸出將會列出 tools 能力(如果存在)。
致謝
此版本歸功於 Georgi Gerganov 和 llama.cpp 維護者,以及硬體合作夥伴 NVIDIA、AMD、Qualcomm 和 Intel 對於 GGML 生態系統優化的貢獻。
社群回饋
如有任何問題、回饋或疑難排解,歡迎使用者加入 Ollama Discord 或發送電子郵件至 hello@ollama.com。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch