charlie12345/ROCmFPX
ROCmFPX Family for AMD Hardware and Processors. More quants and special agent quants
解决的问题
ROCmFPX 提供专为 AMD 硬件设计的 GGUF 模型权重量化格式。它解决了在 Radeon GPU 上实现高效模型存储和快速推理的需求,提供从 2 位到 8 位的多种位宽,针对 AMD 架构进行了优化,相比通用格式减少了内存流量并提高了令牌吞吐量。
工作原理
该项目向 llama.cpp 添加了实验性权重格式,实现了 HIP/ROCm 和 Vulkan 后端的加速内核,并提供了 CPU 参考路径以确保正确性。包含以下量化家族:
- ROCmFP2/3/4/6/8:不同精度的专用浮点型量化格式。
- ROCmI4:一种有符号 4 位整数格式,可利用 AMD Strix Halo(
gfx1151)硬件的原生v_wmma_i32_16x16x16_iu4指令,加速批量矩阵乘法。 - MTP 加速:支持带有嵌入式 MTP/NextN 头的模型的自预测解码,允许模型在单个批次中验证多个提议的令牌,从而提高解码速度。
- 代理感知预设:特定的量化配方(例如
*_COHERENT或*_AGENT),可保护关键张量以维持 JSON 和代码等结构化输出的质量。
适用人群
在 AMD Radeon GPU 上运行 LLM 的用户,特别是使用 llama.cpp 且拥有 Strix Halo(gfx1151)硬件、希望最大化推理性能并最小化显存使用的用户。
主要亮点
- AMD 优化量化:原生支持 2、3、4、6 和 8 位 GGUF 格式。
- 多后端支持:支持 Vulkan 和 HIP/ROCm 的加速路径。
- Strix Halo 专用优化:
gfx1151设备可选启用 IU4/W4A4 加速。 - 预测解码:内置 MTP 加速,无需单独的草稿模型即可实现更快的令牌生成。
- 精度控制:提供从最小(ROCmFP2)到高质量参考(ROCmFP8)的多种格式。
相关
- 项目
- 项目
- 项目
- Dispatch
- Dispatch