kvcache-ai/ktransformers

A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations

What it solves

KTransformers は、超大規模 Mixture‑of‑Experts(MoE)モデルのハードウェア制約を解消します。CPU‑GPU 異種コンピューティングを利用することで、消費者向けハードウェア上でも高性能な推論とファインチューニングが可能となり、膨大な GPU VRAM への依存を削減します。

How it works

このフレームワークはハイブリッド計算アプローチを採用し、ワークロードを GPU と CPU に分散させます。主な技術実装は以下の通りです。

  • Heterogeneous Expert Placement:"Hot" エキスパートは高速化のため GPU に保持し、"cold" エキスパートは CPU にオフロードします。
  • CPU-Optimized Kernels:Intel AMX と AVX512/AVX2 最適化カーネルを使用し、CPU 上での INT4/INT8 量子化推論を高速化します。
  • Memory Management:MoE 推論向けに NUMA 対応メモリ管理を実装し、3 層(GPU‑CPU‑Disk)プレフィックスキャッシュ再利用システムを提供します。
  • SFT Integration:LLaMA-Factory と統合し、従来の ZeRO‑Offload 手法に比べて大幅に高速な大規模 MoE モデルのファインチューニングを実現します。

Who it’s for

  • 超大規模 MoE モデル(例:DeepSeek‑V3/R1)を扱うが、エンタープライズ向け GPU クラスタを持たない研究者・開発者。
  • 消費者向けハードウェア(例:RTX 4090)で最先端 LLM を動かしたいユーザー。
  • ハイブリッド CPU/GPU メモリを用いて大規模モデルを効率的にファインチューニングしたい ML エンジニア。

Highlights

  • Hybrid Inference:CPU‑GPU 異種コンピューティングをサポートし、限られた VRAM でも巨大モデルを実行可能。
  • Broad Hardware Support:NVIDIA GPU、AMD GPU(ROCm)、Intel Arc GPU、Ascend NPU に対応。
  • Quantization:CPU 上の INT4/INT8 と GPU 上の GPTQ/FP8 をサポート。
  • Fine-Tuning Speed:ZeRO‑Offload と比較して MoE SFT ワークロードで 6‑12 倍の学習速度向上。
  • Framework Integration:SGLang との統合を容易にするクリーンな Python API を提供。