charlie12345/ROCmFPX

ROCmFPX Family for AMD Hardware and Processors. More quants and special agent quants

해결하는 문제

ROCmFPX는 AMD 하드웨어에 특화된 GGUF 모델 가중치 양자화 형식을 제공합니다. Radeon GPU에서 효율적인 모델 저장과 빠른 추론을 위해 다양한 비트 폭(2비트에서 8비트까지)을 AMD 아키텍처에 최적화하여 메모리 트래픽을 줄이고 일반 형식보다 토큰 처리량을 높입니다.

작동 방식

이 프로젝트는 llama.cpp에 실험적인 가중치 형식을 추가하고, HIP/ROCm 및 Vulkan 백엔드용 가속 커널을 구현하며, 정확성을 보장하기 위해 CPU 참조 경로도 포함합니다. 다음과 같은 양자화 패밀리가 포함됩니다:

  • ROCmFP2/3/4/6/8: 다양한 정밀도의 특수 부동소수점 유사 양자화.
  • ROCmI4: AMD Strix Halo (gfx1151) 하드웨어에서 네이티브 v_wmma_i32_16x16x16_iu4 명령어를 활용해 배치 행렬 곱셈을 가속화할 수 있는 부호 있는 4비트 정수 형식.
  • MTP 가속: 내장된 MTP/NextN 헤드를 가진 모델을 지원하여, 단일 배치에서 여러 제안 토큰을 검증할 수 있는 자기 추론 디코딩을 가능하게 하여 디코딩 속도를 향상시킵니다.
  • 에이전트 인식 프리셋: JSON 및 코드와 같은 구조화된 출력의 품질을 유지하기 위해 중요한 텐서를 보호하는 특정 양자화 레시피(예: *_COHERENT 또는 *_AGENT)를 제공합니다.

대상 사용자

AMD Radeon GPU에서 LLM을 실행하는 사용자, 특히 llama.cpp를 사용하거나 Strix Halo (gfx1151) 하드웨어를 보유하여 추론 성능을 극대화하고 VRAM 사용량을 최소화하고자 하는 사용자.

주요 특징

  • AMD 최적화 양자화: 2, 3, 4, 6, 8비트 GGUF 형식의 네이티브 지원.
  • 다중 백엔드 지원: Vulkan 및 HIP/ROCm 모두에 대한 가속 경로 지원.
  • Strix Halo 전용 최적화: gfx1151 장치용 옵트인 IU4/W4A4 가속.
  • 추론 예측: 별도의 드래프트 모델 없이 내장된 MTP 가속을 통해 더 빠른 토큰 생성 가능.
  • 정밀도 제어: 가장 작은 크기의 (ROCmFP2)에서 고품질 참조(ROCmFP8)까지 다양한 형식 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch