warpfront/hipfire
RDNA-native LLM inference engine in Rust.
해결하는 문제
hipfire는 AMD GPU(RDNA 및 CDNA 아키텍처)의 잠재력을 극대화하기 위해 설계된 고성능, AMD 네이티브 LLM 추론 엔진입니다. Python, PyTorch, CUDA 번역 계층과 관련된 오버헤드를 제거하기 위해 자체 Rust 기반 런타임, HIP 커널, 그리고 양자화 포맷을 제공함으로써 AMD 하드웨어 사용자에게 'Ollama 스타일'의 사용 경험을 제공합니다.
작동 방식
이 프로젝트는 커스텀 Rust 런타임을 사용하고 동적으로 ROCm을 로드하여 모델을 실행합니다. 주요 기술적 구성 요소는 다음과 같습니다:
- Redline: 커널 그래프를 기록하고 리소스 의존성을 도출하여 그래프가 안전함이 입증된 후에 실행 오버헤드를 제거하는 디스패치 및 유지 재생 기반.
- Saddle: RDNA, CDNA, 그리고 가능하면 XDNA용 최고 수준의 컴퓨팅 백엔드를 제공하기 위해 개발 중인 기반 레이어.
- 커스텀 양자화: MQ4, MQ4R 등 다양한 MQ 형식과 HF4를 지원하여 처리량과 품질을 최적화.
- 아키텍처 튜닝: RDNA3/4용 아키텍처 전용 커널(예: WMMA 경로)을 구현하고, 오래된 GPU(Vega/CDNA)용 포터블 대체 경로를 제공.
대상 사용자
RDNA1-4 소비자용 GPU부터 전문용 CDNA/MI300X까지 다양한 AMD GPU를 보유하고 있으며, Python 기반 스택의 복잡성을 피하면서도 빠르고 로컬에서 LLM 및 이미지 생성 추론을 원하는 사용자.
주요 특징
- AMD 네이티브: Rust + HIP로 구축되어 호트패스에서 Python을 제거하여 최대 효율성 달성.
- 광범위한 GPU 지원: RDNA3/4에 최적화되어 있으며, RDNA1/2 및 Vega/CDNA 아키텍처도 지원.
- OpenAI 호환 API: 데몬이 포트 11435에서 API를 노출하여 기존 클라이언트와의 간편한 통합 가능.
- 큐레이션된 모델 레지스트리: Qwen, DeepSeek, FLUX 등 이미지 생성용 포함하여 80개 이상의 큐레이션된 모델 엔트리 포함.
- C 스타일 CLI:
hipfire pull,hipfire chat와 같은 간단한 명령어로 모델 다운로드, 제공, 대화 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트