Ollama 0.30 发布,新增 GGUF 模型支持并提升 NVIDIA 性能高达 20%

Ollama 0.30 发布,新增 GGUF 模型支持并提升 NVIDIA 性能高达 20%\n\n## TL;DR\nOllama 0.30 通过使用 llama.cpp 增加了原生 GGUF 模型支持,并将 NVIDIA GPU 吞吐量提升了高达 20%,同时默认启用 Vulkan 以将 GPU 加速扩展到 AMD 和 Intel 硬件。\n\n## 更快的 NVIDIA 吞吐量\n得益于 NVIDIA 和 llama.cpp 团队提供的优化,Ollama 0.30 在 NVIDIA GPU 上的性能提升了高达 20%。所示基准测试使用在 RTX 5090 上量化为 Q4_K_M 的 Gemma 4 26B 模型,展示了更高的每秒 token 率。\n\n> 在 NVIDIA RTX 5090 上使用 Q4_K_M 量化运行 Gemma 4 26B 模型进行测试。\n\n## 默认启用 Vulkan 以实现更广泛的 GPU 兼容性\nVulkan 现在已在 Ollama 中默认启用,将 GPU 加速从 Apple silicon 扩展到 AMD 和 Intel 设备。用户不再需要安装特定厂商的库;模型可以在任何兼容 Vulkan 的 GPU 上开箱即用。\n\n## 通过 GGUF 扩展模型兼容性\nOllama 0.30 通过 llama.cpp 集成了 GGUF 生态系统,允许更广泛的模型集在无需自定义转换步骤的情况下运行。支持的模型系列包括:\n- LFM (例如,LiquidAI/LFM2-8B-A1B-GGUF)\n- Prism (例如,prism-ml/Bonsai-8B-gguf)\n- 来自 Unsloth 的微调模型\n\n### 如何从 Hugging Face 运行 GGUF 模型\n1. 下载 GGUF 文件或目录。\n2. 创建一个指向 GGUF 路径的 Modelfile:\n \n FROM ./my-model.Q4_K_M.gguf\n \n3. 使用 Ollama 构建并运行模型:\n \n ollama create -f Modelfile my-model\n ollama run my-model\n \n\n## 工具调用能力得以保留\n如果 GGUF 模型包含 tools 能力,Ollama 会保留工具调用支持,从而实现与编程代理和个人助手的无缝使用。\n\n### 示例启动命令\n- Claude Code: ollama launch claude --model my-model\n- Hermes Agent: ollama launch hermes --model my-model\n- OpenClaw: ollama launch openclaw --model my-model\n\n要确认工具支持,请运行:\nbash\nollama show my-model\n\n输出将会在存在时列出 tools 能力。\n\n## 致谢\n此次发布归功于 Georgi Gerganov 和 llama.cpp 维护者,以及硬件合作伙伴 NVIDIA、AMD、Qualcomm 和 Intel 对 GGML 生态系统优化的贡献。\n\n## 社区反馈\n如有任何问题、反馈或故障排除,欢迎用户加入 Ollama Discord 或发送邮件至 hello@ollama.com

Sources

相关