Ollama 新模型調度更新

Ollama 發布了全新的模型調度系統,將記憶體估算替換為精確的記憶體測量。此更新透過減少記憶體不足(out-of-memory)導致的崩潰來提高系統穩定性,並透過最大化 GPU 利用率和優化多 GPU 調度來提升效能。

精確記憶體測量與系統穩定性

Ollama 的新引擎現在會計算執行模型所需的精確記憶體量,而非依賴估算。這種向精確記憶體管理的轉變消除了過度配置,從而顯著降低了因記憶體不足(OOM)問題引起的崩潰頻率。

GPU 利用率與效能提升

新的調度系統透過為 GPU 分配更多記憶體來最大化 GPU 利用率,這直接增加了 token 生成速度和 prompt 處理速度。此優化也延伸至多 GPU 配置,Ollama 現在能在多張顯卡之間更有效地調度模型,提升了多 GPU 以及不同規格 GPU 配置下的效能。

效能基準測試

在使用單張 NVIDIA GeForce RTX 4090 的測試中,具有 128k context length 的 gemma3:12b 模型顯示出 token 生成速度的顯著提升,從 52.02 tokens/s 增加到 85.54 tokens/s,同時 VRAM 使用量從 19.9GiB 增加到 21.4GiB,且所有 49 層都已載入至 GPU。

對於使用兩張 NVIDIA GeForce RTX 4090 GPU 並搭配 mistral-small3.2 模型與 32k context length 的圖像輸入任務,prompt 評估速度從 127.84 tokens/s 增加到 1380.24 tokens/s,而 token 生成速度從 43.15 tokens/s 增加到 55.61 tokens/s。在此配置下,所有 41 層和 vision model 都已載入至 GPU。

系統監控與報告

記憶體報告現在已在各工具之間同步。在 ollama ps 中顯示的測量值現在將與 nvidia-smi 報告的數值一致,為使用者提供了一種一致且準確的方式來追蹤系統上的記憶體利用率。

模型支援與可用性

此全新的記憶體管理功能已在 Ollama 新引擎實現的所有模型中預設啟用。支援的模型包括:

  • GPT-OSS: gpt-oss
  • Llama: llama4, llama3.2-vision (即將推出 llama3.2, llama3.1, 以及 llama3)
  • Gemma: gemma3, embeddinggemma, gemma3n
  • Qwen: qwen3, qwen2.5vl (即將推出 `qwen3-coder)
  • Mistral: mistral-small3.2
  • Embedding Models: all-minilm 與其他 embedding models

Sources

相關