charlie12345/ROCmFPX
ROCmFPX Family for AMD Hardware and Processors. More quants and special agent quants
解決的問題
ROCmFPX 提供專為 AMD 硬體設計的 GGUF 模型權重量化格式。它解決了在 Radeon GPU 上實現高效模型儲存與快速推論的需求,提供從 2 位到 8 位的多種位寬,針對 AMD 架構進行優化,相比通用格式減少記憶體流量並提升令牌吞吐量。
工作原理
此專案向 llama.cpp 新增實驗性權重格式,實作 HIP/ROCm 與 Vulkan 後端的加速內核,並提供 CPU 參考路徑以確保正確性。包含以下量化家族:
- ROCmFP2/3/4/6/8:不同精度的專用浮點型量化格式。
- ROCmI4:一種有符號 4 位整數格式,可利用 AMD Strix Halo(
gfx1151)硬體的原生v_wmma_i32_16x16x16_iu4指令,加速批量矩陣乘法。 - MTP 加速:支援內建 MTP/NextN head 的模型進行自我預測解碼,允許模型在單一批次中驗證多個建議的 token,從而提升解碼速度。
- 代理感知預設:特定的量化配方(例如
*_COHERENT或*_AGENT),可保護關鍵張量以維持 JSON 與程式碼等結構化輸出的品質。
適用對象
在 AMD Radeon GPU 上執行 LLM 的使用者,特別是使用 llama.cpp 且擁有 Strix Halo(gfx1151)硬體、希望最大化推論效能並最小化顯存使用的使用者。
主要亮點
- AMD 優化量化:原生支援 2、3、4、6 和 8 位 GGUF 格式。
- 多後端支援:支援 Vulkan 與 HIP/ROCm 的加速路徑。
- Strix Halo 專用優化:
gfx1151裝置可選啟用 IU4/W4A4 加速。 - 預測解碼:內建 MTP 加速,無需額外草稿模型即可實現更快的 token 生成。
- 精度控制:提供從最小(ROCmFP2)到高品質參考(ROCmFP8)的多種格式。
相關
- 專案
- 專案
- 專案
- Dispatch
- Dispatch