kvcache-ai/ktransformers

A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations

何を解決するか

KTransformersは、超大規模なMixture-of-Experts(MoE)モデルの実行およびファインチューニングに必要な高コストのハードウェア要件を低減します。CPU-GPUの異種コンピューティングを活用することで、一般消費者向けのハードウェアでもこれらのモデルを実行可能にします。これにより、高価なGPU VRAMの大量消費を回避できます。

動作方法

このフレームワークは、モデルの異なる部分を異なるハードウェアに配置するハイブリッドコンピューティングアプローチを採用しています。頻繁に使用される「ホット」エキスパートはGPU上に保持し、使用頻度の低い「コールド」エキスパートはCPUにオフロードする「エキスパートスケジューリング」を用います。パフォーマンスを維持するために、Intel AMXおよびAVX512/AVX2向けの最適化カーネルを用いて量子化推論を実行し、LlamaFactoryと統合してLoRAやブロックFP8などの技術を活用した効率的なファインチューニング(SFT)を可能にしています。これは従来のZeRO-Offload手法よりも大幅に高速化できます。

対象ユーザー

限られたハードウェア(例:一般向けGPUやCPU-GPU混合サーバー構成)で最先端の大規模モデル(DeepSeek-V3/R1やGLMなど)を実行またはファインチューニングしたい研究者や開発者向けです。

特徴

  • 異種コンピューティング: CPU-GPUハイブリッド推論およびファインチューニングをサポートし、VRAMのハードルを低下させます。
  • ハードウェア加速: Intel AMX、AVX512、AVX2に最適化され、ROCm(AMD)およびAscend NPUもサポートしています。
  • MoE最適化: Mixture-of-Expertsモデル向けの専用メモリ管理とエキスパートスケジューリングを提供します。
  • ファインチューニング統合: LlamaFactoryとシームレスに統合され、超大規模モデルのLoRAおよび全パラメータファインチューニングが可能になります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト