brontoguana/krasis

Krasis is a Hybrid LLM runtime which focuses on efficient running of larger models on consumer grade VRAM limited hardware

해결하는 문제

Krasis를 사용하면 사용자가 소비자용 NVIDIA GPU에서 수천억 개의 매개변수를 가진 대규모 Mixture-of-Experts (MoE) 모델을 실행할 수 있습니다. 모델 가중치가 시스템 RAM과 VRAM 사이에서 어떻게 저장되고 이동하는지 관리하여 이러한 모델이 표준 GPU VRAM에 들어맞기에는 너무 크다는 문제를 해결합니다.

작동 방식

Krasis는 Rust와 CUDA로 작성된 고성능 런타임을 사용하여 모델 실행을 조율합니다. 메모리 발자국을 줄이고 속도를 높이기 위해 여러 핵심 기술을 사용합니다:

  • HCS 전문가 상주 관리: VRAM과 CPU RAM 간에 "핫" 및 "콜드" 전문가를 동적으로 이동시켜 관리함으로써, 사용 가능한 VRAM보다 큰 모델도 여전히 작동할 수 있게 합니다.
  • 양자화: 모델 가중치를 압축하기 위해 캐시된 INT4/INT8 전문가 형식과 HQQ 어텐션 캐시를 구축합니다.
  • 컴팩트 KV 캐싱: Key-Value 캐시가 사용하는 메모리를 줄이기 위해 특수 모드(k6v6k4v4 등)를 제공합니다.
  • GPU 가속 처리: 빠른 프롬프트 처리를 위해 전체 GPU 프리필을 사용하고 GPU에서 디코드를 실행합니다.

대상

엔터프라이즈급 하드웨어 없이도 로컬에서 최첨단 대규모 MoE 모델을 실행하려는 NVIDIA GPU(Ampere 아키텍처 이상) 보유 개발자 및 AI 애호가를 위해 설계되었습니다.

하이라이트

  • 폭넓은 모델 지원: DeepSeek-V4, Qwen3, Gemma 4 및 Nemotron MoE를 포함한 제품군에 대해 검증되었습니다.
  • OpenAI 호환성: OpenAI 호환 API를 제공하며 네이티브 모델 도구 호출 구문을 구조화된 tool_calls로 변환합니다.
  • Krasis Manager: GPU VRAM 사용량을 모니터링하고 JSON API를 통해 모델 구성을 관리하는 Rust 기반 대시보드입니다.
  • 크로스 플랫폼: Windows용 기본 설치 프로그램과 Linux/WSL2 지원을 제공합니다.
  • 성능 도구: 기본 제공되는 반복 가능한 벤치마크와 전용 채팅 클라이언트가 포함되어 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트