kvcache-ai/ktransformers
A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations
What it solves
KTransformers 解決了執行超大型 Mixture‑of‑Experts(MoE)模型的硬體限制。它透過 CPU‑GPU 異構計算,使使用者能在消費級硬體上執行高效能推理與微調,減少對大量昂貴 GPU VRAM 的依賴。
How it works
此框架採用混合計算方式,將工作負載在 GPU 與 CPU 之間分割。主要技術實作包括:
- Heterogeneous Expert Placement:將「熱」專家保留在 GPU 上以提升速度,將「冷」專家卸載至 CPU。
- CPU-Optimized Kernels:使用 Intel AMX 與 AVX512/AVX2 最佳化的 kernel,加速 CPU 上的 INT4/INT8 量化推理。
- Memory Management:實作 NUMA 感知的記憶體管理以支援 MoE 推理,並提供 3 層(GPU‑CPU‑Disk)前綴快取重用系統。
- SFT Integration:與 LLaMA-Factory 整合,使大型 MoE 模型的微調速度遠快於傳統 ZeRO‑Offload 方法。
Who it’s for
- 研究人員與開發者,使用超大型 MoE 模型(如 DeepSeek‑V3/R1)但缺乏企業級 GPU 叢集。
- 想在消費級硬體(例如 RTX 4090)上執行最前沿 LLM 的使用者。
- 尋求以混合 CPU/GPU 記憶體方式高效微調大型模型的機器學習工程師。
Highlights
- Hybrid Inference:支援 CPU‑GPU 異構計算,在有限 VRAM 下執行巨型模型。
- Broad Hardware Support:相容於 NVIDIA GPU、AMD GPU(ROCm)、Intel Arc GPU 與 Ascend NPU。
- Quantization:支援 CPU 上的 INT4/INT8 以及 GPU 上的 GPTQ/FP8。
- Fine-Tuning Speed:相較 ZeRO‑Offload,MoE SFT 工作負載可提升 6‑12 倍訓練速度。
- Framework Integration:提供乾淨的 Python API,便於與 SGLang 整合。