kvcache-ai/ktransformers

A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations

What it solves

KTransformers는 초대형 Mixture‑of‑Experts(MoE) 모델을 실행할 때 발생하는 하드웨어 제한을 해결합니다. CPU‑GPU 이기종 컴퓨팅을 이용해 소비자 등급 하드웨어에서도 고성능 추론 및 파인튜닝이 가능하도록 하여, 대량의 비싼 GPU VRAM 의 의존도를 낮춥니다.

How it works

이 프레임워크는 하이브리드 컴퓨팅 방식을 채택해 작업 부하를 GPU와 CPU에 분산합니다. 주요 기술 구현은 다음과 같습니다.

  • Heterogeneous Expert Placement: "Hot" 전문가를 속도 향상을 위해 GPU에 유지하고, "cold" 전문가는 CPU로 오프로드합니다.
  • CPU-Optimized Kernels: Intel AMX와 AVX512/AVX2 최적화 커널을 사용해 CPU에서 INT4/INT8 양자화 추론을 가속합니다.
  • Memory Management: MoE 추론을 위한 NUMA 인식 메모리 관리와 3계층(GPU‑CPU‑Disk) 프리픽스 캐시 재사용 시스템을 구현합니다.
  • SFT Integration: LLaMA-Factory와 통합해 기존 ZeRO‑Offload 방식보다 훨씬 빠른 대규모 MoE 모델 파인튜닝을 가능하게 합니다.

Who it’s for

  • 초대형 MoE 모델(예: DeepSeek‑V3/R1)을 다루지만 엔터프라이즈급 GPU 클러스터가 없는 연구자 및 개발자.
  • 소비자용 하드웨어(예: RTX 4090)에서 최첨단 LLM을 실행하고자 하는 사용자.
  • 하이브리드 CPU/GPU 메모리를 활용해 대규모 모델을 효율적으로 파인튜닝하려는 ML 엔지니어.

Highlights

  • Hybrid Inference: 제한된 VRAM에서도 대규모 모델을 실행할 수 있도록 CPU‑GPU 이기종 컴퓨팅을 지원합니다.
  • Broad Hardware Support: NVIDIA GPU, AMD GPU(ROCm), Intel Arc GPU, Ascend NPU와 호환됩니다.
  • Quantization: CPU에서는 INT4/INT8, GPU에서는 GPTQ/FP8을 지원합니다.
  • Fine-Tuning Speed: ZeRO‑Offload 대비 MoE SFT 작업에서 6‑12배의 학습 속도 향상을 제공합니다.
  • Framework Integration: SGLang과의 통합을 위한 깔끔한 Python API를 제공합니다.