Ollama 0.19 Preview: MLX Integration for Apple Silicon Acceleration

Ollamaは、Apple Silicon上でのモデル実行において可能な限り高速なパフォーマンスを提供するため、AppleのMLX機械学習フレームワークを統合したOllama 0.19のプレビュー版をリリースしました。このアップデートは、Appleのユニファイドメモリ・アーキテクチャと新しいGPU Neural Acceleratorsを活用することで、コーディングエージェントやパーソナルアシスタントなどの負荷の高いローカルAIワークロードの加速に焦点を当てています。

MLX-Powered Performance on Apple Silicon

Ollamaは現在、MLXフレームワークを利用して、モデルがApple Siliconのユニファイドメモリ・アーキテクチャとどのように相互作用するかを最適化しています。この統合により、すべてのApple Siliconデバイスにおいて大幅なスピードアップが実現し、特に最初のトークン生成までの時間(TTFT)と生成速度(tokens per second)の両方の改善をターゲットとしています。

M5、M5 Pro、およびM5 Maxチップでは、OllamaはGPU Neural Acceleratorsを活用してパフォーマンスをさらに向上させます。2026年3月29日にQwen3.5-35B-A3Bモデルを使用して実施されたテストに基づくと、Ollama 0.19はint4量子化を利用する場合、1851 token/sのprefillと134 token/sのdecodeを達成すると予測されています。

NVFP4 Support and Production Parity

Ollamaは現在、NVIDIAのNVFP4フォーマットをサポートしており、これによりモデルの精度を維持しながら、推論ワークロードのメモリ帯域幅とストレージ要件を削減できます。このサポートにより、主に2つの利点が得られます:

  1. Production Parity: Users can achieve results consistent with those from large-scale inference providers who use the NVFP4 format.
  2. Optimization Compatibility: Ollama can now run models optimized by NVIDIA's model optimizer.

その他の精度フォーマットは、今後の研究やハードウェアパートナーの要件に基づいて提供される予定です。

Enhanced Caching for Agentic Workflows

Ollamaは、コーディングやエージェント的なタスクの応答性を向上させるために、キャッシュメカニズムをアップグレードしました。これらの改善点には以下が含まれます:

  • Cross-Conversation Cache Reuse: Ollamaは異なる会話間でキャッシュを再利用し、共有システムプロンプトから分岐する場合(例:Claude Codeのようなツールを使用する場合)のメモリ利用率を下げ、キャッシュヒット率を高めます。
  • Intelligent Checkpoints: システムは現在、プロンプト内の戦略的な場所にキャッシュスナップショットを保存し、これにより必要なプロンプト処理量を減らし、応答時間を加速させます。
  • Smarter Eviction: 共有プリフィックスは、古いブランチが破棄された場合でも、より長く保持されます。

Implementation and Model Support

これらの機能を利用するには、32GB以上のユニファイドメモリを搭載したMacが必要です。プレビューリリースでは、コーディングタスク向けにサンプリングパラメータが調整されたQwen3.5-35B-A3Bモデルを具体的に加速させます。

ユーザーは、以下のコマンドを使用して特定のツール向けにモデルを起動できます:

  • Claude Code: ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4
  • OpenClaw: ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4
  • General Chat: ollama run qwen3.5:35b-a3b-coding-nvfp4

Ollamaは、サポートされているアーキテクチャのリストを拡張しており、サポートされているアーキテクチャ上でファインチューニングされたカスタムモデルを使用するユーザー向けに、簡素化されたインポートプロセスを導入する予定です。

Sources

関連