kvcache-ai/ktransformers

A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations

解決的問題

KTransformers 解決了執行與微調超大型混合專家(MoE)模型所需的高硬體需求。透過利用 CPU-GPU 異構運算,讓這些模型能在消費級硬體上運行,減少對大量昂貴 GPU 顯存的需求。

工作原理

此框架採用混合運算方式,將模型的不同部分置於不同硬體上。它使用「專家排程」技術,將頻繁使用的「熱」專家保留在 GPU 上,而將「冷」專家卸載至 CPU。為維持效能,它利用針對 Intel AMX 與 AVX512/AVX2 優化的內核進行量化推論,並與 LlamaFactory 整合,支援使用 LoRA 與 block-FP8 等技術實現高效微調(SFT),其速度可顯著快於傳統的 ZeRO-Offload 方法。

適用對象

適合希望在有限硬體(如消費級 GPU 或 CPU-GPU 混合伺服器架構)上執行或微調最尖端大模型(如 DeepSeek-V3/R1 或 GLM)的研究人員與開發者。

主要亮點

  • 異構運算:支援 CPU-GPU 混合推論與微調,降低顯存門檻。
  • 硬體加速:針對 Intel AMX、AVX512、AVX2 優化,並支援 ROCm(AMD)與 Ascend NPUs。
  • MoE 優化:專為混合專家模型設計的記憶體管理與專家排程機制。
  • 微調整合:與 LlamaFactory 無縫整合,支援超大型模型的 LoRA 與全參數微調。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案