kvcache-ai/ktransformers
A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations
What it solves
KTransformers 解决了运行超大 Mixture‑of‑Experts(MoE)模型的硬件限制。它通过 CPU‑GPU 异构计算,使用户能够在消费级硬件上进行高性能推理和微调,降低对大量昂贵 GPU VRAM 的依赖。
How it works
该框架采用混合计算方式,将工作负载在 GPU 与 CPU 之间分割。关键技术实现包括:
- Heterogeneous Expert Placement:将“热”专家保留在 GPU 上以提升速度,将“冷”专家卸载到 CPU。
- CPU-Optimized Kernels:使用 Intel AMX 与 AVX512/AVX2 优化的 kernel,加速 CPU 上的 INT4/INT8 量化推理。
- Memory Management:实现 NUMA 感知的内存管理以支持 MoE 推理,并提供 3 层(GPU‑CPU‑Disk)前缀缓存复用系统。
- SFT Integration:与 LLaMA-Factory 集成,使大规模 MoE 模型的微调速度远快于传统 ZeRO‑Offload 方法。
Who it’s for
- 研究人员和开发者,使用超大 MoE 模型(如 DeepSeek‑V3/R1)但缺乏企业级 GPU 集群。
- 想在消费级硬件(例如 RTX 4090)上运行前沿 LLM 的用户。
- 寻求使用混合 CPU/GPU 内存高效微调大模型的机器学习工程师。
Highlights
- Hybrid Inference:支持 CPU‑GPU 异构计算,在有限 VRAM 下运行巨型模型。
- Broad Hardware Support:兼容 NVIDIA GPU、AMD GPU(ROCm)、Intel Arc GPU 与 Ascend NPU。
- Quantization:支持 CPU 上的 INT4/INT8 以及 GPU 上的 GPTQ/FP8。
- Fine-Tuning Speed:相较 ZeRO‑Offload,MoE SFT 工作负载可提升 6‑12 倍训练速度。
- Framework Integration:提供简洁的 Python API,便于与 SGLang 集成。