Ollama 0.19 Preview: MLX Integration for Apple Silicon Acceleration

Ollama는 Apple의 MLX 머신러닝 프레임워크를 통합하여 Apple Silicon에서 모델을 실행할 때 가능한 가장 빠른 성능을 제공하는 Ollama 0.19 프리뷰 버전을 출시했습니다. 이번 업데이트는 Apple의 통합 메모리 아키텍처와 새로운 GPU Neural Accelerators를 활용하여 코딩 에이전트 및 개인 비서와 같은 까다로운 로컬 AI 워크로드를 가속화하는 데 중점을 둡니다.

MLX-Powered Performance on Apple Silicon

Ollama는 이제 MLX 프레임워크를 활용하여 모델이 Apple Silicon의 통합 메모리 아키텍처와 상호작용하는 방식을 최적화합니다. 이 통합은 모든 Apple Silicon 장치에서 상당한 속도 향상을 제공하며, 특히 첫 번째 토큰 생성 시간(TTFT)과 생성 속도(tokens per second) 모두에서 개선을 목표로 합니다.

M5, M5 Pro, 및 M5 Max 칩에서는 Ollama가 GPU Neural Accelerators를 활용하여 성능을 더욱 향상시킵니다. 2026년 3월 29일에 Qwen3.5-35B-A3B 모델을 사용하여 수행된 테스트 결과에 따르면, Ollama 0.19는 int4 양자화를 사용할 때 1851 token/s prefill 및 134 token/s decode를 달성할 것으로 예상됩니다.

NVFP4 Support and Production Parity

Ollama는 이제 NVIDIA의 NVFP4 형식을 지원하여, 모델 정확도를 유지하면서 추론 워크로드에 대한 메모리 대역폭 및 저장 공간 요구 사항을 줄여줍니다. 이 지원은 두 가지 주요 이점을 제공합니다:

  1. Production Parity: Users can achieve results consistent with those from large-scale inference providers who use the NVFP4 format. (사용자는 NVFP4 형식을 사용하는 대규모 추론 제공업체의 결과와 일치하는 결과를 얻을 수 있습니다.)
  2. Optimization Compatibility: Ollama can now run models optimized by NVIDIA's model optimizer. (Ollama는 이제 NVIDIA의 model optimizer로 최적화된 모델을 실행할 수 있습니다.)

기타 정밀도 형식은 연구 및 하드웨어 파트너의 요구 사항에 따라 향후 제공될 예정입니다.

Enhanced Caching for Agentic Workflows

Ollama는 코딩 및 에이전트 작업의 응답성을 개선하기 위해 캐싱 메커니즘을 업그레이드했습니다. 이러한 개선 사항은 다음과 같습니다:

  • Cross-Conversation Cache Reuse: Ollama는 서로 다른 대화 간에 캐시를 재사용하여, 공유 시스템 프롬프트에서 분기될 때(예: Claude Code와 같은 도구를 사용할 때) 메모리 사용량을 줄이고 캐시 히트율을 높입니다.
  • Intelligent Checkpoints: 시스템은 이제 프롬프트 내의 전략적 위치에 캐시 스냅샷을 저장하여, 필요한 프롬프트 처리량을 줄이고 응답 시간을 가속화합니다.
  • Smarter Eviction: 공유 접두사(Shared prefixes)는 이전 브랜치가 삭제되더라도 더 오래 보존됩니다.

Implementation and Model Support

이러한 기능을 활용하려면 32GB 이상의 통합 메모리를 갖춘 Mac을 사용해야 합니다. 프리뷰 릴리스는 코딩 작업을 위해 튜닝된 샘플링 파라미터를 가진 Qwen3.5-35B-A3B 모델을 구체적으로 가속화합니다.

사용자는 다음 명령어를 사용하여 특정 도구를 위한 모델을 실행할 수 있습니다:

  • Claude Code: ollama launch claude --model qwen3.5:35b-a3b-coding-nvfp4
  • OpenClaw: ollama launch openclaw --model qwen3.5:35b-a3b-coding-nvfp4
  • General Chat: ollama run qwen3.5:35b-a3b-coding-nvfp4

Ollama는 지원되는 아키텍처의 목록을 확장하고 있으며, 지원되는 아키텍처에서 미세 조정된 사용자 정의 모델에 대한 간소화된 가져오기 프로세스를 도입할 계획입니다.

Sources

관련