ikawrakow/ik_llama.cpp
llama.cpp fork with additional SOTA quants and improved performance
它解决了什么问题
ik_llama.cpp 是 llama.cpp 的一个高性能分支,旨在提升 CPU 推理性能并引入前沿的量化方法。它通过提供更快的 CPU 提示处理速度以及扩展支持的量化类型范围,解决了主线版本的局限性,从而实现更高效的模型运行。
它如何工作
该项目实现了多种先进的量化内核和优化技术。它利用专用的 CPU 后端(AVX2、AVX-512 和 ARM_NEON)以及 CUDA(Turing 或更新架构)来加速矩阵乘法。关键技术实现包括 Trellis 量化、IQK 量化、K 缓存和 V 缓存的 Hadamard 变换,以及适用于多 GPU 配置的「图」拆分模式和针对 MoE 与密集模型的自动 VRAM 降载功能。
适合谁使用
希望在消费级硬件上以更高效率运行大型语言模型(LLMs)的用户,特别是依赖 CPU 密集型推理或混合 CPU/GPU 配置的用户,以及需要提前体验新推理功能(如 MTP 解码和融合 delta 网络)的开发者。
主要亮点
- 提升的 CPU 性能:非交错量化和 MoE 模型在提示处理方面获得显著加速。
- 先进的量化支持:支持 Trellis 量化(
IQ1_KT到IQ4_KT)、IQK 量化和 MXFP4。 - 广泛的模型兼容性:支持众多现代模型,包括 DeepSeek-V3/V4、Qwen3、Gemma 4 和 Llama-4。
- 推理功能丰富:包含 MTP 解码、自推测解码,以及支持 MCP 的内置 WebUI。
- 硬件优化:对 AVX-512(Zen4/Sapphire Rapids+)和 CUDA Turing+ GPU 提供专用支持。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch