ikawrakow/ik_llama.cpp
llama.cpp fork with additional SOTA quants and improved performance
해결하는 문제
ik_llama.cpp는 CPU 추론 성능을 향상시키고 최첨단 양자화 기법을 도입하기 위해 설계된 llama.cpp의 고성능 포크입니다. 메인라인 버전의 한계를 극복하여 CPU에서 더 빠른 프롬프트 처리를 제공하고, 모델 효율성을 높이기 위해 지원되는 양자화 유형의 범위를 확장합니다.
작동 방식
이 프로젝트는 다양한 고급 양자화 커널과 최적화를 구현합니다. 행렬 곱셈을 가속화하기 위해 특화된 CPU 백엔드(AVX2, AVX-512, ARM_NEON)와 CUDA(Turing 이상)를 사용합니다. 주요 기술적 구현에는 Trellis 양자화, IQK 양자화, K캐시 및 V캐시용 하다마르드 변환을 포함하며, 멀티 GPU 환경용 '그래프 분할 모드'와 MoE 및 밀집 모델용 자동 VRAM 오프로드 기능도 제공합니다.
대상 사용자
소비자용 하드웨어에서 더 효율적으로 대규모 언어 모델(LLM)을 실행하고자 하는 사용자, 특히 CPU 중심 추론 또는 하이브리드 CPU/GPU 환경에 의존하는 사용자, 그리고 MTP 디코딩과 융합된 델타 넷과 같은 새로운 추론 기능에 조기 접근이 필요한 개발자에게 적합합니다.
주요 특징
- 강화된 CPU 성능: 비인터리브 양자화 및 MoE 모델에서 프롬프트 처리 속도가 크게 향상됨.
- 고급 양자화: Trellis 양자화(
IQ1_KT~IQ4_KT), IQK 양자화, MXFP4 지원. - 광범위한 모델 호환성: DeepSeek-V3/V4, Qwen3, Gemma 4, Llama-4 등 다양한 최신 모델과 호환.
- 추론 기능: MTP 디코딩, 자가 사전 추론 디코딩, MCP 지원 내장 WebUI 포함.
- 하드웨어 최적화: AVX-512(Zen4/Sapphire Rapids+) 및 CUDA Turing+ GPU 전용 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch