warpfront/hipfire
RDNA-native LLM inference engine in Rust.
解決的問題
hipfire 是一個高效率、AMD 原生的 LLM 推論引擎,旨在最大化 AMD GPU(RDNA 與 CDNA 架構)的潛力。它透過提供自有的 Rust 基礎執行時、HIP 內核與量化格式,消除 Python、PyTorch 與 CUDA 翻譯層的開銷,為 AMD 硬體使用者提供類似 Ollama 的使用體驗。
工作原理
此專案使用自訂的 Rust 執行時,並動態載入 ROCm 來執行模型。主要技術元件包括:
- Redline:一個調度與保留重播基礎架構,記錄內核圖並推導資源相依性,一旦圖形被證明安全,即可消除啟動開銷。
- Saddle:正在開發中的基礎層,旨在為 RDNA、CDNA,以及未來可能的 XDNA 提供一流的計算後端。
- 自訂量化:支援多種 MQ 格式(例如 MQ4、MQ4R)與 HF4,以優化吞吐量與品質。
- 架構調校:實作針對 RDNA3/4 的架構特定內核(如 WMMA 路徑),並為舊型 GPU(Vega/CDNA)提供可移植的備用方案。
適用對象
擁有 AMD GPU(從消費級 RDNA1-4 到專業級 CDNA/MI300X)並希望在不使用複雜 Python 堆疊的情況下,實現快速本地 LLM 與影像生成推論的使用者。
主要亮點
- AMD 原生:以 Rust + HIP 建構,從熱路徑中移除 Python,達成最大效率。
- 廣泛的 GPU 支援:針對 RDNA3/4 優化,同時支援 RDNA1/2 與 Vega/CDNA 架構。
- OpenAI 相容 API:守護程序在 11435 端口公開 API,方便與現有客戶端整合。
- 精選模型註冊表:包含超過 80 筆精選模型條目,包括 Qwen、DeepSeek 與用於影像生成的 FLUX。
- C 風格 CLI:使用簡單指令進行模型拉取、服務啟動與對話(例如
hipfire pull、hipfire chat)。
相關
- 專案
- 專案
- 專案
- 專案
- 專案