warpfront/hipfire
RDNA-native LLM inference engine in Rust.
해결하는 문제
hipfire는 소비자용 카드, 프로용 카드 및 APU를 포함하여 AMD RDNA GPU(RDNA1부터 RDNA4까지)에 특별히 최적화된 고성능 LLM 추론 엔진입니다. 공식 ROCm 지원이 데이터 센터용 카드에만 국한되는 경우가 많아 기존의 llama.cpp + ROCm과 같은 도구를 사용하기 어려운 소비자용 AMD 하드웨어에서 LLM을 실행하는 문제를 해결합니다.
작동 원리
Rust와 HIP로 구축된 hipfire는 실행 경로에서 Python과 PyTorch를 제거한 단일 바이너리를 제공합니다. 사전 컴파일된 커널 블롭과 HIP를 통한 JIT 컴파일을 사용하여 다양한 RDNA 아키텍처를 타겟팅합니다. 이 엔진은 DeepSeek V4 Flash와 같은 대규모 MoE 모델을 위한 멀티 GPU 전문가 병렬 서빙을 지원하며, 토큰 생성 속도를 높이기 위해投機적 디코딩(DFlash)을 구현합니다.
대상 사용자
최대 하드웨어 활용도와 성능으로 로컬 LLM을 실행하기 위한 간소화된 "Ollama 스타일" 경험을 원하는 AMD RDNA GPU 사용자.
주요 특징
- 폭넓은 AMD 지원: RDNA 제품군 전체(RDNA1부터 RDNA4까지)를 타겟팅합니다.
- OpenAI 호환 API: HTTP API를 통해 모델을 서빙하기 위한 백그라운드 데몬을 포함합니다.
- 투기적 디코딩: 특정 프롬프트에 대해 디코딩 속도를 크게 향상시키는 DFlash를 구현합니다.
- 멀티 GPU 지원: 대규모 모델을 위해 여러 GPU에 걸친 전문가 병렬 샤딩을 지원합니다.
- 양자화 도구: HF, safetensors 및 GGUF 모델을 변환하기 위한
hipfire quantize를 포함합니다. - 메모리 관리: CASK 기반 KV 캐시 제거를 사용하여 메모리 부족 없이 긴 컨텍스트 프롬프트를 처리합니다.