Ollama 新模型调度更新
Ollama 发布了一个新的模型调度系统,用精确的内存测量取代了内存估算。此次更新通过减少内存溢出(OOM)崩溃并最大限度地提高 GPU 利用率和优化多 GPU 调度,提升了系统的稳定性并提高了性能。
精确内存测量与系统稳定性
Ollama 的新引擎现在计算运行模型所需的精确内存量,而不是依赖估算。这种向精确内存管理的转变消除了过度分配,从而显著降低了由内存溢出(OOM)问题引起的崩溃频率。
GPU 利用率与性能提升
新的调度系统通过为 GPU 分配更多内存来最大限度地提高 GPU 利用率,这直接提高了 token 生成和 prompt 处理速度。这种优化扩展到了多 GPU 设置,Ollama 现在可以在多个显卡之间更高效地调度模型,从而提高多 GPU 和非对称 GPU 配置下的性能。
性能基准测试
在单张 NVIDIA GeForce RTX 4090 的测试中,具有 128k 上下文长度的 gemma3:12b 模型显示出 token 生成速度的显著提升,从 52.02 tokens/s 增加到 85.54 tokens/s,同时 VRAM 使用量从 19.9GiB 增加到 21.4GiB,且所有 49 层都已加载到 GPU 上。
对于使用两张 NVIDIA GeForce RTX 4090 GPU 且具有 32k 上下文长度的 mistral-small3.2 模型进行图像输入任务,prompt 评估速度从 127.84 tokens/s 增加到 1380.24 tokens/s,token 生成速度从 43.15 tokens/s 增加到 55.61 tokens/s。在这种配置下,所有 41 层和视觉模型都已加载到 GPU 上。
系统监控与报告
内存报告现在已在工具之间同步。在 ollama ps 中显示的测量值现在将与 nvidia-smi 报告的值相匹配,为用户提供了一种一致且准确的方式来跟踪系统的内存利用率。
模型支持与可用性
对于在 Ollama 新引擎中实现的所有模型,此项新的内存管理功能默认启用。支持的模型包括:
- GPT-OSS:
gpt-oss - Llama:
llama4,llama3.2-vision(即将推出llama3.2,llama3.1, 和llama3) - Gemma:
gemma3,embeddinggemma,gemma3n - Qwen:
qwen3,qwen2.5vl(即将推出qwen3-coder) - Mistral:
mistral-small3.2 - Embedding Models:
all-minilm和其他 embedding 模型
Sources
- OriginalNew model scheduling
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- Dispatch