charlie12345/ROCmFPX

ROCmFPX Family for AMD Hardware and Processors. More quants and special agent quants

解决的问题

ROCmFPX 提供专为 AMD 硬件设计的 GGUF 模型权重量化格式。它解决了在 Radeon GPU 上实现高效模型存储和快速推理的需求,提供从 2 位到 8 位的多种位宽,针对 AMD 架构进行了优化,相比通用格式减少了内存流量并提高了令牌吞吐量。

工作原理

该项目向 llama.cpp 添加了实验性权重格式,实现了 HIP/ROCm 和 Vulkan 后端的加速内核,并提供了 CPU 参考路径以确保正确性。包含以下量化家族:

  • ROCmFP2/3/4/6/8:不同精度的专用浮点型量化格式。
  • ROCmI4:一种有符号 4 位整数格式,可利用 AMD Strix Halo(gfx1151)硬件的原生 v_wmma_i32_16x16x16_iu4 指令,加速批量矩阵乘法。
  • MTP 加速:支持带有嵌入式 MTP/NextN 头的模型的自预测解码,允许模型在单个批次中验证多个提议的令牌,从而提高解码速度。
  • 代理感知预设:特定的量化配方(例如 *_COHERENT*_AGENT),可保护关键张量以维持 JSON 和代码等结构化输出的质量。

适用人群

在 AMD Radeon GPU 上运行 LLM 的用户,特别是使用 llama.cpp 且拥有 Strix Halo(gfx1151)硬件、希望最大化推理性能并最小化显存使用的用户。

主要亮点

  • AMD 优化量化:原生支持 2、3、4、6 和 8 位 GGUF 格式。
  • 多后端支持:支持 Vulkan 和 HIP/ROCm 的加速路径。
  • Strix Halo 专用优化gfx1151 设备可选启用 IU4/W4A4 加速。
  • 预测解码:内置 MTP 加速,无需单独的草稿模型即可实现更快的令牌生成。
  • 精度控制:提供从最小(ROCmFP2)到高质量参考(ROCmFP8)的多种格式。

相关