kvcache-ai/ktransformers
A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations
何を解決するか
KTransformersは、超大規模なMixture-of-Experts(MoE)モデルの実行およびファインチューニングに必要な高コストのハードウェア要件を低減します。CPU-GPUの異種コンピューティングを活用することで、一般消費者向けのハードウェアでもこれらのモデルを実行可能にします。これにより、高価なGPU VRAMの大量消費を回避できます。
動作方法
このフレームワークは、モデルの異なる部分を異なるハードウェアに配置するハイブリッドコンピューティングアプローチを採用しています。頻繁に使用される「ホット」エキスパートはGPU上に保持し、使用頻度の低い「コールド」エキスパートはCPUにオフロードする「エキスパートスケジューリング」を用います。パフォーマンスを維持するために、Intel AMXおよびAVX512/AVX2向けの最適化カーネルを用いて量子化推論を実行し、LlamaFactoryと統合してLoRAやブロックFP8などの技術を活用した効率的なファインチューニング(SFT)を可能にしています。これは従来のZeRO-Offload手法よりも大幅に高速化できます。
対象ユーザー
限られたハードウェア(例:一般向けGPUやCPU-GPU混合サーバー構成)で最先端の大規模モデル(DeepSeek-V3/R1やGLMなど)を実行またはファインチューニングしたい研究者や開発者向けです。
特徴
- 異種コンピューティング: CPU-GPUハイブリッド推論およびファインチューニングをサポートし、VRAMのハードルを低下させます。
- ハードウェア加速: Intel AMX、AVX512、AVX2に最適化され、ROCm(AMD)およびAscend NPUもサポートしています。
- MoE最適化: Mixture-of-Expertsモデル向けの専用メモリ管理とエキスパートスケジューリングを提供します。
- ファインチューニング統合: LlamaFactoryとシームレスに統合され、超大規模モデルのLoRAおよび全パラメータファインチューニングが可能になります。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト