spiritbuun/buun-llama-cpp

Experimental llama.cpp fork for inference research and development

해결하는 문제

buun-llama-cpp는 VRAM 제약이 있는 하드웨어에서 LLM 추론 효율을 최대화하도록 설계된 llama.cpp의 실험적 연구 포크입니다. 동적 KV 캐시 양자화와 고급 MoE(혼합 전문가) 캐싱 전략을 도입하여 컨텍스트 길이, 메모리 사용량, 모델 품질 간의 균형을 구체적으로 해결합니다.

작동 방식

이 프로젝트는 몇 가지 핵심 기술 혁신을 구현합니다:

  • 가변 비트레이트(VBR) KV 캐시: 고정된 양자화 수준 대신, VBR은 세션이 성장함에 따라 KV 캐시를 동적으로 양자화합니다. FP16에서 시작하여 VRAM 압력이 필요할 때만 미리 정의된 "사다리" 코덱을 사용하여 레이어별로 성능을 저하시키며, 현재 컨텍스트 깊이에 대해 가능한 최고 품질을 보장합니다.
  • Trellis 부호화 양자화(TCQ): 512 상텨의 trellis와 Viterbi 부호화를 사용하는 전문화된 코덱으로, 표준 스칼라 양자화와 비해 매오 낮은 비트레이트(2-3 비트)에서 KL 발산(오차)을 상당히 줄입니다.
  • MoE 캐싱: 대규모 MoE 모델(예: DeepSeek V4 Flas)의 경우, 라우팅된 전문가를 시스텨 RAM에 상주시키고, "핫" 전문가 텐서를 예비 VRAM에 캐싱하여 추론을 가속할 수 있습니다.
  • 비전용 GPU 스왑: VRAM을 절약하기 위해, 이미지가 처리될 때만 비전 인코더(mmproj)를 GPU에 로드하기 위해 투기적 디코딩 구성 요소를 임시로 언로드한 후 다시 스왑할 수 있습니다.

대상 사용자

소비자용 GPU(예: RTX 3090)에서 대규모 모델을 작업하는 개발자와 연구자로, 모델 정확도를 너무 희생하지 않고 컨텍스트 창 크기와 추론 속도의 한계를 넓히고자 하는 사람들.

하이라이트

  • 동적 품질 제어: VBR은 캐싱가 FP16에서 1.25 비트/값까지 우아하게 성능을 저하시킬 수 있습니다.
  • 고효율 코덱: TCQ는 3.25 비트/값에서 FP16에 가까운 퍼플렉시티를 제공합니다.
  • 적응형 MoE 관리: 대규모 MoE 모델을 위한 자동 피팅 및 전문가 병렬 디스패치.
  • VRAM 최적화: 비전 인코더와 투기적 디코딩 사이드카 간의 지능적인 스와핑.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch