Ollama 0.19 Preview: MLX Integration for Apple Silicon Acceleration

Ollama 发布了 Ollama 0.19 的预览版本,集成了 Apple 的 MLX 机器学习框架,旨在为在 Apple Silicon 上运行模型提供尽可能快的性能。此次更新专注于通过利用 Apple 的统一内存架构和新的 GPU Neural Accelerators,来加速高要求的本地 AI 工作负载,例如编程代理(coding agents)和个人助手。

MLX-Powered Performance on Apple Silicon

Ollama 现在利用 MLX 框架来优化模型与 Apple Silicon 统一内存架构的交互方式。这种集成在所有 Apple Silicon 设备上都提供了显著的速度提升,特别针对首字生成时间(TTFT)和生成速度(tokens per second)进行了改进。

在 M5、M5 Pro 和 M5 Max 芯片上,Ollama 利用 GPU Neural Accelerators 进一步增强性能。根据 2026 年 3 月 29 日使用 Qwen3.5-35B-A3B 模型进行的测试,在使用 int4 量化时,Ollama 0.19 预计可实现 1851 token/s 的 prefill 和 134 token/s 的 decode。

NVFP4 Support and Production Parity

Ollama 现在支持 NVIDIA 的 NVFP4 格式,这在保持模型准确性的同时,降低了推理工作负载的内存带宽和存储需求。这种支持提供了两个主要优势:

  1. Production Parity: 用户可以获得与使用 NVFP4 格式的大规模推理提供商一致的结果。
  2. Optimization Compatibility: Ollama 现在可以运行由 NVIDIA 的 model optimizer 优化的模型。

其他精度格式将在未来根据研究和硬件合作伙伴的需求提供。

Enhanced Caching for Agentic Workflows

Ollama 升级了其缓存机制,以提高编程和代理任务的响应速度。这些改进包括:

  • Cross-Conversation Cache Reuse: Ollama 在不同的对话中复用其缓存,从而在从共享系统提示词(例如使用 Claude Code 等工具)进行分支时,减少内存利用率并增加缓存命中率。
  • Intelligent Checkpoints: 系统现在会在提示词中的战略位置存储缓存快照,从而减少所需的提示词处理量并加速响应时间。
  • Smarter Eviction: 即使在丢弃较旧的分支时,共享前缀也会保留更长时间。

Implementation and Model Support

要使用这些功能,用户需要一台拥有超过 32GB 统一内存的 Mac。此预览版特别加速了 Qwen3.5-35B-A3B 模型,其采样参数已针对编程任务进行了微调。

用户可以使用以下命令为特定工具启动模型:

  • Claude Code: ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4
  • OpenClaw: ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4
  • General Chat: ollama run qwen3.5:35b-a3b-coding-nvfp4

Ollama 正在扩大支持的架构列表,并计划为在支持的架构上微调了自定义模型的用户引入一个简化的导入过程。

Sources

相关