Kaden-Schutt/hipfire
RDNA-native LLM inference engine in Rust.
What it solves
hipfire 提供專為 AMD RDNA GPU(消費者、專業與 APU)最佳化的高效能 LLM 推論。它解決了在消費者 AMD 硬體上執行模型的困難,傳統工具如搭配 ROCm 的 llama.cpp 常常笨重,且往往把消費者卡視為次等於資料中心硬體。
How it works
使用 Rust 與 HIP 建置,專案以單一二進位檔發布,從執行時熱路徑中移除 Python 與 PyTorch。它利用預編譯的 kernel blob 與 HIP 的 JIT 編譯,支援整個 RDNA 系列(RDNA1~RDNA4)。引擎具備統一的 kernel 調度系統(GEMM、attention、MoE 等),並支援如投機解碼(DFlash)與多 GPU 設定的 expert‑parallel 服務等進階技術。
Who it’s for
擁有 AMD RDNA GPU、希望以最小軟體負擔、最大硬體利用率在本機執行 LLM,並獲得類似 Ollama 體驗的使用者。
Highlights
- Broad Hardware Support: 支援 RDNA1、RDNA2、RDNA3 與 RDNA4,涵蓋消費者、專業與 APU 變種。
- High Performance: 在 RDNA3 硬體(例如 7900 XTX)上相較於 Ollama 有顯著的解碼加速。
- Speculative Decoding: 實作 DFlash,能大幅提升特定模型的 token 產生速度。
- Multi-GPU Support: Expert‑parallel 服務允許將大型 MoE 模型(如 DeepSeek V4 Flash)切分至多張 GPU。
- Memory Management: 內建基於 CASK 的 KV 快取驅逐機制,防止長上下文提示時發生記憶體不足(OOM)錯誤。
- Developer Friendly: 提供相容 OpenAI 的 API 與簡易 CLI,支援模型的拉取、執行與服務。