charlie12345/ROCmFPX

ROCmFPX Family for AMD Hardware and Processors. More quants and special agent quants

解決的問題

ROCmFPX 提供專為 AMD 硬體設計的 GGUF 模型權重量化格式。它解決了在 Radeon GPU 上實現高效模型儲存與快速推論的需求,提供從 2 位到 8 位的多種位寬,針對 AMD 架構進行優化,相比通用格式減少記憶體流量並提升令牌吞吐量。

工作原理

此專案向 llama.cpp 新增實驗性權重格式,實作 HIP/ROCm 與 Vulkan 後端的加速內核,並提供 CPU 參考路徑以確保正確性。包含以下量化家族:

  • ROCmFP2/3/4/6/8:不同精度的專用浮點型量化格式。
  • ROCmI4:一種有符號 4 位整數格式,可利用 AMD Strix Halo(gfx1151)硬體的原生 v_wmma_i32_16x16x16_iu4 指令,加速批量矩陣乘法。
  • MTP 加速:支援內建 MTP/NextN head 的模型進行自我預測解碼,允許模型在單一批次中驗證多個建議的 token,從而提升解碼速度。
  • 代理感知預設:特定的量化配方(例如 *_COHERENT*_AGENT),可保護關鍵張量以維持 JSON 與程式碼等結構化輸出的品質。

適用對象

在 AMD Radeon GPU 上執行 LLM 的使用者,特別是使用 llama.cpp 且擁有 Strix Halo(gfx1151)硬體、希望最大化推論效能並最小化顯存使用的使用者。

主要亮點

  • AMD 優化量化:原生支援 2、3、4、6 和 8 位 GGUF 格式。
  • 多後端支援:支援 Vulkan 與 HIP/ROCm 的加速路徑。
  • Strix Halo 專用優化gfx1151 裝置可選啟用 IU4/W4A4 加速。
  • 預測解碼:內建 MTP 加速,無需額外草稿模型即可實現更快的 token 生成。
  • 精度控制:提供從最小(ROCmFP2)到高品質參考(ROCmFP8)的多種格式。

相關