Ollama 0.30 릴리스: GGUF 모델 지원 추가 및 NVIDIA 성능 최대 20% 향상
요약 (TL;DR)
Ollama 0.30은 llama.cpp를 사용하여 네이티브 GGUF 모델 지원을 추가하고 NVIDIA GPU 처리량을 최대 20%까지 높이며, Vulkan을 기본적으로 활성화하여 AMD 및 Intel 하드웨어로 GPU 가속을 확장합니다.
더 빠른 NVIDIA 처리량
NVIDIA 및 llama.cpp 팀의 최적화 기여 덕분에 Ollama 0.30은 NVIDIA GPU에서의 성능을 최대 20%까지 향상시켰습니다. 표시된 벤치마크는 RTX 5090에서 Q4_K_M으로 양자화된 Gemma 4 26B 모델을 사용하여 더 높은 초당 토큰 생성률을 보여줍니다.
NVIDIA RTX 5090에서 Q4_K_M 양자화를 사용하여 실행되는 Gemma 4 26B 모델로 테스트되었습니다.
더 넓은 GPU 호환성을 위한 기본 Vulkan 지원
Vulkan이 이제 Ollama에서 기본적으로 활성화되어, Apple silicon을 넘어 AMD 및 Intel 장치로 GPU 가속이 확장되었습니다. 사용자는 더 이상 벤더별 라이브러리를 설치할 필요가 없으며, 모델은 모든 Vulkan 호환 GPU에서 즉시 실행됩니다.
GGUF를 통한 모델 호환성 확장
Ollama 0.30은 llama.cpp를 통해 GGUF 생태계를 통합하여, 별도의 커스텀 변환 단계 없이 더 광범위한 모델 세트를 실행할 수 있도록 합니다. 지원되는 모델군은 다음과 같습니다:
- LFM (예: LiquidAI/LFM2-8B-A1B-GGUF)
- Prism (예: prism-ml/Bonsai-8B-gguf)
- Unsloth의 미세 조정(Fine-tuned) 모델
Hugging Face에서 GGUF 모델을 실행하는 방법
- GGUF 파일 또는 디렉토리를 다운로드합니다.
- GGUF 경로를 가리키는
Modelfile을 생성합니다:FROM ./my-model.Q4_K_M.gguf - Ollama를 사용하여 모델을 빌드하고 실행합니다:
ollama create -f Modelfile my-model ollama run my-model
도구 호출(Tool-Calling) 기능 유지
GGUF 모델에 tools 기능이 포함되어 있다면, Ollama는 도구 호출 지원을 유지하여 코딩 에이전트 및 개인 비서와의 원활한 사용을 가능하게 합니다.
실행 명령 예시
- Claude Code:
ollama launch claude --model my-model - Hermes Agent:
ollama launch hermes --model my-model - OpenClaw:
ollama launch openclaw --model my-model
도구 지원 여부를 확인하려면 다음을 실행하십시오:
ollama show my-model
tools 기능이 있는 경우 출력 결과에 표시됩니다.
감사의 글
이번 릴리스는 GGML 생태계 최적화에 기여한 Georgi Gerganov와 llama.cpp 유지 관리자들, 그리고 하드웨어 파트너인 NVIDIA, AMD, Qualcomm, Intel에 감사를 표합니다.
커뮤니티 피드백
질문, 피드백 또는 문제 해결을 위해 사용자는 Ollama Discord에 참여하거나 hello@ollama.com으로 이메일을 보내주시기 바랍니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch