warpfront/hipfire
RDNA-native LLM inference engine in Rust.
解決的問題
hipfire 是專門針對 AMD RDNA GPU(從 RDNA1 到 RDNA4)優化的高性能 LLM 推理引擎,包括消費級顯卡、專業級顯卡與 APU。它解決了在消費級 AMD 硬體上執行 LLM 的難題,因為官方的 ROCm 支援通常僅限於數據中心顯卡,導致現有的工具(如 llama.cpp + ROCm)使用起來往往非常痛苦。
工作原理
hipfire 基於 Rust 與 HIP 構建,提供單一二進位檔案,在執行路徑中避免了 Python 與 PyTorch。它使用預編譯的內核 blob 與透過 HIP 進行的 JIT 編譯來針對各種 RDNA 架構。該引擎支援針對 DeepSeek V4 Flash 等大型 MoE 模型的多 GPU 專家並行推理,並實現了投機解碼 (DFlash) 以提高 Token 生成速度。
適用對象
擁有 AMD RDNA GPU 且希望以最大硬體利用率與性能執行本地 LLM,並尋求流線化「Ollama 風格」體驗的用戶。
亮點
- 廣泛的 AMD 支援: 針對整個 RDNA 系列(RDNA1 到 RDNA4)。
- 相容 OpenAI 的 API: 包括一個用於透過 HTTP API 提供模型服務的後台守護進程。
- 投機解碼: 實現 DFlash 以顯著提升特定提示詞的解碼速度。
- 多 GPU 支援: 支援針對大型模型的跨多 GPU 專家並行分片。
- 量化工具: 包括用於轉換 HF、safetensors 與 GGUF 模型的
hipfire quantize。 - 記憶體管理: 使用基於 CASK 的 KV 快取驅逐機制,在不耗盡記憶體的情況下處理長上下文提示詞。