ikawrakow/ik_llama.cpp

llama.cpp fork with additional SOTA quants and improved performance

解決的問題

ik_llama.cppllama.cpp 的高效能分支,專為提升 CPU 推理效能並引入先進的量化方法而設計。它克服了主分支版本的限制,提供更快的提示處理速度,並擴展支援的量化類型,以提升模型效率。

如何運作

此專案實作多種先進的量化核心與優化技術。它利用專用的 CPU 後端(AVX2、AVX-512 和 ARM_NEON)以及 CUDA(Turing 或更新版本)來加速矩陣乘法運算。關鍵技術實作包括 Trellis 量化、IQK 量化,以及針對 K-cache 和 V-cache 的 Hadamard 變換,同時支援多 GPU 環境下的「圖形」分割模式,以及自動適配 VRAM 離線處理功能,適用於 MoE 與密集模型。

適用對象

希望在消費級硬體上以更高效率運行大型語言模型(LLMs)的使用者,特別是依賴 CPU 進行大量推論或採用混合 CPU/GPU 架構的用戶,以及需要提前取得新推論功能(如 MTP 解碼與融合 delta-net)的開發者。

主要特色

  • 強化 CPU 性能:非交錯量化與 MoE 模型在提示處理上獲得顯著加速。
  • 先進量化技術:支援 Trellis 量化(IQ1_KTIQ4_KT)、IQK 量化與 MXFP4。
  • 廣泛模型支援:相容多種現代模型,包括 DeepSeek-V3/V4、Qwen3、Gemma 4 與 Llama-4。
  • 推論功能:內建 MTP 解碼、自我猜測式解碼,以及支援 MCP 的內建 WebUI。
  • 硬體優化:針對 AVX-512(Zen4/Sapphire Rapids+)與 CUDA Turing+ GPU 提供專用支援。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch