kvcache-ai/ktransformers

A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations

해결하는 문제

KTransformers는 초대규모 혼합 전문가(Mixture-of-Experts, MoE) 모델을 실행하고 미세조정하기 위한 높은 하드웨어 요구 사항을 해결합니다. CPU-GPU 이종 컴퓨팅을 활용하여 일반 소비자용 하드웨어에서도 이러한 모델을 실행할 수 있게 하여, 고가의 GPU VRAM을 대량으로 필요로 하지 않도록 합니다.

작동 방식

이 프레임워크는 모델의 다양한 부분을 서로 다른 하드웨어에 배치하는 하이브리드 컴퓨팅 접근 방식을 사용합니다. 자주 사용되는 '핫' 전문가(expert)는 GPU에 유지하고, 덜 사용되는 '콜드' 전문가는 CPU로 오프로드하는 '전문가 스케줄링'을 활용합니다. 성능을 유지하기 위해 Intel AMX 및 AVX512/AVX2용 최적화 커널을 사용하여 양자화된 추론을 수행하며, LlamaFactory와 통합하여 LoRA 및 블록-FP8와 같은 기술을 활용한 효율적인 미세조정(SFT)을 가능하게 합니다. 이는 기존의 ZeRO-Offload 방법보다 훨씬 빠를 수 있습니다.

대상 사용자

소비자용 GPU나 CPU-GPU 혼합 서버 환경과 같은 제한된 하드웨어에서 최신 대규모 모델(예: DeepSeek-V3/R1 또는 GLM)을 실행하거나 미세조정하고자 하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 이종 컴퓨팅: CPU-GPU 하이브리드 추론 및 미세조정을 지원하여 VRAM 장벽을 낮춥니다.
  • 하드웨어 가속: Intel AMX, AVX512, AVX2에 최적화되었으며, ROCm(AMD) 및 Ascend NPU도 지원합니다.
  • MoE 최적화: 혼합 전문가 모델을 위한 전용 메모리 관리 및 전문가 스케줄링을 제공합니다.
  • 미세조정 통합: LlamaFactory와 원활하게 통합되어 초대규모 모델의 LoRA 및 전체 파라미터 미세조정이 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트