kvcache-ai/ktransformers
A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations
What it solves
KTransformers は、超大規模 Mixture‑of‑Experts(MoE)モデルのハードウェア制約を解消します。CPU‑GPU 異種コンピューティングを利用することで、消費者向けハードウェア上でも高性能な推論とファインチューニングが可能となり、膨大な GPU VRAM への依存を削減します。
How it works
このフレームワークはハイブリッド計算アプローチを採用し、ワークロードを GPU と CPU に分散させます。主な技術実装は以下の通りです。
- Heterogeneous Expert Placement:"Hot" エキスパートは高速化のため GPU に保持し、"cold" エキスパートは CPU にオフロードします。
- CPU-Optimized Kernels:Intel AMX と AVX512/AVX2 最適化カーネルを使用し、CPU 上での INT4/INT8 量子化推論を高速化します。
- Memory Management:MoE 推論向けに NUMA 対応メモリ管理を実装し、3 層(GPU‑CPU‑Disk)プレフィックスキャッシュ再利用システムを提供します。
- SFT Integration:LLaMA-Factory と統合し、従来の ZeRO‑Offload 手法に比べて大幅に高速な大規模 MoE モデルのファインチューニングを実現します。
Who it’s for
- 超大規模 MoE モデル(例:DeepSeek‑V3/R1)を扱うが、エンタープライズ向け GPU クラスタを持たない研究者・開発者。
- 消費者向けハードウェア(例:RTX 4090)で最先端 LLM を動かしたいユーザー。
- ハイブリッド CPU/GPU メモリを用いて大規模モデルを効率的にファインチューニングしたい ML エンジニア。
Highlights
- Hybrid Inference:CPU‑GPU 異種コンピューティングをサポートし、限られた VRAM でも巨大モデルを実行可能。
- Broad Hardware Support:NVIDIA GPU、AMD GPU(ROCm)、Intel Arc GPU、Ascend NPU に対応。
- Quantization:CPU 上の INT4/INT8 と GPU 上の GPTQ/FP8 をサポート。
- Fine-Tuning Speed:ZeRO‑Offload と比較して MoE SFT ワークロードで 6‑12 倍の学習速度向上。
- Framework Integration:SGLang との統合を容易にするクリーンな Python API を提供。