Ollama 새로운 모델 스케줄링 업데이트

Ollama는 메모리 추정 대신 정확한 메모리 측정을 사용하는 새로운 모델 스케줄링 시스템을 출시했습니다. 이번 업데이트는 메모리 부족(OOM)으로 인한 충돌을 줄여 시스템 안정성을 개선하고, GPU 활용도를 극대화하며 멀티 GPU 스케줄링을 최적화하여 성능을 향상시킵니다.

정확한 메모리 측정 및 시스템 안정성

Ollama의 새로운 엔진은 이제 추정에 의존하는 대신 모델을 실행하는 데 필요한 정확한 메모리 양을 계산합니다. 이러한 정확한 메모리 관리 방식으로의 전환은 과다 할당을 제거하여, 메모리 부족(OOM) 문제로 인한 충돌 빈도를 크게 줄여줍니다.

GPU 활용도 및 성능 향상

새로운 스케줄링 시스템은 GPU에 더 많은 메모리를 할당하여 GPU 활용도를 극대화하며, 이는 토큰 생성 및 프롬프트 처리 속도를 모두 직접적으로 향상시킵니다. 이러한 최적화는 멀티 GPU 설정으로도 확장되어, Ollama는 이제 여러 카드에 걸쳐 모델을 더 효율적으로 스케줄링하여 멀티 GPU 및 사양이 다른 GPU 구성 모두에서 성능을 개선합니다.

성능 벤치마크

단일 NVIDIA GeForce RTX 4090을 사용한 테스트에서, 128k 컨텍스트 길이를 가진 gemma3:12b 모델은 토큰 생성 속도가 52.02 tokens/s에서 85.54 tokens/s로 크게 증가했으며, VRAM 사용량은 19.9GiB에서 21.4GiB로 증가했고 49개 레이어 모두가 GPU에 로드되었습니다.

두 개의 NVIDIA GeForce RTX 4090 GPU를 사용하여 mistral-small3.2 모델과 32k 컨텍스트 길이를 사용하는 이미지 입력 작업의 경우, 프롬프트 평가 속도가 127.84 tokens/s에서 1380.24 tokens/s로 증가했고, 토큰 생성 속도가 43.15 tokens/s에서 55.61 tokens/s로 상승했습니다. 이 구성에서 41개 레이어와 비전 모델 모두 GPU에 로드되었습니다.

시스템 모니터링 및 보고

메모리 보고가 이제 도구 간에 동기화됩니다. ollama ps에서 표시되는 측정값은 이제 nvidia-smi에서 보고되는 값과 일치하게 되어, 사용자가 시스템의 메모리 활용도를 추적하는 일관되고 정확한 방법을 제공합니다.

모델 지원 및 가용성

이 새로운 메모리 관리 기능은 Ollama의 새로운 엔진에 구현된 모든 모델에 대해 기본적으로 활성화됩니다. 지원되는 모델은 다음과 같습니다:

  • GPT-OSS: gpt-oss
  • Llama: llama4, llama3.2-vision (곧 llama3.2, llama3.1, llama3가 출시될 예정입니다)
  • Gemma: gemma3, embeddinggemma, gemma3n
  • Qwen: qwen3, qwen2.5vl (곧 qwen3-coder가 출시될 예정입니다)
  • Mistral: mistral-small3.2
  • Embedding Models: all-minilm 및 기타 임베딩 모델들

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트
  • Dispatch