kvcache-ai/ktransformers

A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations

解决的问题

KTransformers 解决了运行和微调超大规模混合专家(MoE)模型所需的高硬件要求。通过利用 CPU-GPU 异构计算,使这些模型能够在消费级硬件上运行,从而减少对大量昂贵 GPU 显存的需求。

工作原理

该框架采用混合计算方法,将模型的不同部分部署在不同硬件上。它使用“专家调度”技术,将频繁使用的“热”专家保留在 GPU 上,而将“冷”专家卸载到 CPU 上。为保持性能,它利用针对 Intel AMX 和 AVX512/AVX2 优化的内核进行量化推理,并与 LlamaFactory 集成,支持使用 LoRA 和 block-FP8 等技术实现高效的微调(SFT),其速度可显著快于传统的 ZeRO-Offload 方法。

适用人群

适用于希望在有限硬件(如消费级 GPU 或 CPU-GPU 混合服务器配置)上运行或微调前沿大模型(如 DeepSeek-V3/R1 或 GLM)的研究人员和开发者。

主要亮点

  • 异构计算:支持 CPU-GPU 混合推理和微调,降低显存门槛。
  • 硬件加速:针对 Intel AMX、AVX512、AVX2 优化,并支持 ROCm(AMD)和 Ascend NPUs。
  • MoE 优化:专为混合专家模型设计的内存管理和专家调度机制。
  • 微调集成:与 LlamaFactory 无缝集成,支持超大模型的 LoRA 和全参数微调。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目