Ollama 0.19 Preview: MLX Integration for Apple Silicon Acceleration

Ollama 已發佈 Ollama 0.19 的預覽版本,整合了 Apple 的 MLX 機器學習框架,旨在為在 Apple Silicon 上執行模型提供最快的效能。此次更新專注於透過利用 Apple 的統一記憶體架構和新的 GPU Neural Accelerators,來加速高需求的本地 AI 工作負載,例如程式碼代理(coding agents)和個人助理。

MLX-Powered Performance on Apple Silicon

Ollama 現在利用 MLX 框架來優化模型與 Apple Silicon 統一記憶體架構的互動方式。此整合為所有 Apple Silicon 裝置提供了大幅度的速度提升,特別針對首字生成時間(TTFT)和生成速度(tokens per second)進行了改進。

在 M5、M5 Pro 和 M5 Max 晶片上,Ollama 利用 GPU Neural Accelerators 進一步增強效能。根據 2026 年 3 月 29 日使用 Qwen3.5-35B-A3B 模型進行的測試,在使用 int4 量化時,Ollama 0.19 預計在 prefill 階段可達到 1851 token/s,在 decode 階段可達到 134 token/s。

NVFP4 Support and Production Parity

Ollama 現在支援 NVIDIA 的 NVFP4 格式,這能在維持模型準確度的同時,減少推論工作負載的記憶體頻寬和儲存需求。此支援提供了兩個主要優點:

  1. Production Parity: Users 可以在使用 NVFP4 格式的大規模推論提供商所獲得的結果中,取得與其一致的結果。
  2. Optimization Compatibility: Ollama 現在可以執行由 NVIDIA's model optimizer 優化的模型。

其他精度格式將根據研究和硬體合作夥伴的需求,在未來提供。

Enhanced Caching for Agentic Workflows

Ollama 已升級其快取機制,以提高程式碼和代理型任務的響應速度。這些改進包括:

  • Cross-Conversation Cache Reuse: Ollama 會在不同的對話之間重複使用其快取,從而減少記憶體利用率並在從共享系統提示詞(例如使用 Claude Code 等工具)分支時增加快取命中率。
  • Intelligent Checkpoints: 系統現在會在提示詞中的策略性位置儲存快取快照,這能減少所需的提示詞處理量並加速回應時間。
  • Smarter Eviction: 共享前綴會被保留更長時間,即使在較舊的分支被捨棄時也是如此。

Implementation and Model Support

要使用這些功能,使用者需要一台擁有超過 32GB 統一記憶體的 Mac。此預覽版本特別針對 Qwen3.5-35B-A3B 模型進行了加速,並針對程式碼任務調整了採樣參數。

使用者可以使用以下指令來為特定工具啟動模型:

  • Claude Code: ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4
  • OpenClaw: ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4
  • General Chat: ollama run qwen3.5:35b-a3b-coding-nvfp4

Ollama 正在擴大支援的架構列表,並計劃為在支援的架構上進行微調的自定義模型使用者,引入一個簡化的導入流程。

Sources

相關