Kaden-Schutt/hipfire

RDNA-native LLM inference engine in Rust.

What it solves

hipfire는 AMD RDNA GPU(소비자, 프로, APU) 전용으로 최적화된 고성능 LLM 추론을 제공합니다. 표준 도구인 llama.cpp와 ROCm을 사용하면 소비자용 AMD 하드웨어에서 모델을 실행하기가 번거롭고, 종종 데이터센터용 하드웨어에 비해 소비자 카드를 2등 시민으로 취급하는 문제가 있습니다.

How it works

Rust와 HIP로 빌드되며, 단일 바이너리 형태로 배포되어 런타임 핫 경로에서 Python과 PyTorch를 제거합니다. 사전 컴파일된 커널 블롭과 HIP의 JIT 컴파일을 활용해 RDNA 전체 계열(RDNA1~RDNA4)을 타깃으로 합니다. 엔진은 커널(GEMM, attention, MoE 등)용 통합 디스패치 시스템을 제공하고, 투기적 디코딩(DFlash) 및 멀티 GPU 환경을 위한 expert‑parallel 서빙과 같은 고급 기술을 지원합니다.

Who it’s for

AMD RDNA GPU를 보유하고 있으며, 로컬에서 LLM을 실행할 때 하드웨어 활용도를 최대화하고 소프트웨어 오버헤드를 최소화한 "Ollama 스타일" 경험을 원하는 사용자에게 적합합니다.

Highlights

  • Broad Hardware Support: RDNA1, RDNA2, RDNA3, RDNA4를 지원하며, 소비자, 프로, APU 변형을 모두 포괄합니다.
  • High Performance: RDNA3 하드웨어(예: 7900 XTX)에서 Ollama 대비 상당한 디코드 속도 향상을 제공합니다.
  • Speculative Decoding: DFlash를 구현해 특정 모델의 토큰 생성 속도를 크게 높입니다.
  • Multi-GPU Support: Expert‑parallel 서빙을 통해 대형 MoE 모델(예: DeepSeek V4 Flash)을 여러 GPU에 걸쳐 샤딩할 수 있습니다.
  • Memory Management: CASK 기반 KV 캐시 제거 기능을 포함해 긴 컨텍스트 프롬프트 시 OOM 오류를 방지합니다.
  • Developer Friendly: OpenAI 호환 API와 간단한 CLI를 제공해 모델을 풀링, 실행 및 서빙하는 과정을 쉽게 합니다.