kvcache-ai/ktransformers

A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations

What it solves

KTransformers 解決了執行超大型 Mixture‑of‑Experts(MoE)模型的硬體限制。它透過 CPU‑GPU 異構計算,使使用者能在消費級硬體上執行高效能推理與微調,減少對大量昂貴 GPU VRAM 的依賴。

How it works

此框架採用混合計算方式,將工作負載在 GPU 與 CPU 之間分割。主要技術實作包括:

  • Heterogeneous Expert Placement:將「熱」專家保留在 GPU 上以提升速度,將「冷」專家卸載至 CPU。
  • CPU-Optimized Kernels:使用 Intel AMX 與 AVX512/AVX2 最佳化的 kernel,加速 CPU 上的 INT4/INT8 量化推理。
  • Memory Management:實作 NUMA 感知的記憶體管理以支援 MoE 推理,並提供 3 層(GPU‑CPU‑Disk)前綴快取重用系統。
  • SFT Integration:與 LLaMA-Factory 整合,使大型 MoE 模型的微調速度遠快於傳統 ZeRO‑Offload 方法。

Who it’s for

  • 研究人員與開發者,使用超大型 MoE 模型(如 DeepSeek‑V3/R1)但缺乏企業級 GPU 叢集。
  • 想在消費級硬體(例如 RTX 4090)上執行最前沿 LLM 的使用者。
  • 尋求以混合 CPU/GPU 記憶體方式高效微調大型模型的機器學習工程師。

Highlights

  • Hybrid Inference:支援 CPU‑GPU 異構計算,在有限 VRAM 下執行巨型模型。
  • Broad Hardware Support:相容於 NVIDIA GPU、AMD GPU(ROCm)、Intel Arc GPU 與 Ascend NPU。
  • Quantization:支援 CPU 上的 INT4/INT8 以及 GPU 上的 GPTQ/FP8。
  • Fine-Tuning Speed:相較 ZeRO‑Offload,MoE SFT 工作負載可提升 6‑12 倍訓練速度。
  • Framework Integration:提供乾淨的 Python API,便於與 SGLang 整合。