warpfront/hipfire

RDNA-native LLM inference engine in Rust.

解決的問題

hipfire 是一個高效率、AMD 原生的 LLM 推論引擎,旨在最大化 AMD GPU(RDNA 與 CDNA 架構)的潛力。它透過提供自有的 Rust 基礎執行時、HIP 內核與量化格式,消除 Python、PyTorch 與 CUDA 翻譯層的開銷,為 AMD 硬體使用者提供類似 Ollama 的使用體驗。

工作原理

此專案使用自訂的 Rust 執行時,並動態載入 ROCm 來執行模型。主要技術元件包括:

  • Redline:一個調度與保留重播基礎架構,記錄內核圖並推導資源相依性,一旦圖形被證明安全,即可消除啟動開銷。
  • Saddle:正在開發中的基礎層,旨在為 RDNA、CDNA,以及未來可能的 XDNA 提供一流的計算後端。
  • 自訂量化:支援多種 MQ 格式(例如 MQ4、MQ4R)與 HF4,以優化吞吐量與品質。
  • 架構調校:實作針對 RDNA3/4 的架構特定內核(如 WMMA 路徑),並為舊型 GPU(Vega/CDNA)提供可移植的備用方案。

適用對象

擁有 AMD GPU(從消費級 RDNA1-4 到專業級 CDNA/MI300X)並希望在不使用複雜 Python 堆疊的情況下,實現快速本地 LLM 與影像生成推論的使用者。

主要亮點

  • AMD 原生:以 Rust + HIP 建構,從熱路徑中移除 Python,達成最大效率。
  • 廣泛的 GPU 支援:針對 RDNA3/4 優化,同時支援 RDNA1/2 與 Vega/CDNA 架構。
  • OpenAI 相容 API:守護程序在 11435 端口公開 API,方便與現有客戶端整合。
  • 精選模型註冊表:包含超過 80 筆精選模型條目,包括 Qwen、DeepSeek 與用於影像生成的 FLUX。
  • C 風格 CLI:使用簡單指令進行模型拉取、服務啟動與對話(例如 hipfire pullhipfire chat)。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案