Kaden-Schutt/hipfire

RDNA-native LLM inference engine in Rust.

What it solves

hipfire 提供專為 AMD RDNA GPU(消費者、專業與 APU)最佳化的高效能 LLM 推論。它解決了在消費者 AMD 硬體上執行模型的困難,傳統工具如搭配 ROCm 的 llama.cpp 常常笨重,且往往把消費者卡視為次等於資料中心硬體。

How it works

使用 Rust 與 HIP 建置,專案以單一二進位檔發布,從執行時熱路徑中移除 Python 與 PyTorch。它利用預編譯的 kernel blob 與 HIP 的 JIT 編譯,支援整個 RDNA 系列(RDNA1~RDNA4)。引擎具備統一的 kernel 調度系統(GEMM、attention、MoE 等),並支援如投機解碼(DFlash)與多 GPU 設定的 expert‑parallel 服務等進階技術。

Who it’s for

擁有 AMD RDNA GPU、希望以最小軟體負擔、最大硬體利用率在本機執行 LLM,並獲得類似 Ollama 體驗的使用者。

Highlights

  • Broad Hardware Support: 支援 RDNA1、RDNA2、RDNA3 與 RDNA4,涵蓋消費者、專業與 APU 變種。
  • High Performance: 在 RDNA3 硬體(例如 7900 XTX)上相較於 Ollama 有顯著的解碼加速。
  • Speculative Decoding: 實作 DFlash,能大幅提升特定模型的 token 產生速度。
  • Multi-GPU Support: Expert‑parallel 服務允許將大型 MoE 模型(如 DeepSeek V4 Flash)切分至多張 GPU。
  • Memory Management: 內建基於 CASK 的 KV 快取驅逐機制,防止長上下文提示時發生記憶體不足(OOM)錯誤。
  • Developer Friendly: 提供相容 OpenAI 的 API 與簡易 CLI,支援模型的拉取、執行與服務。