localai-org/apex-quant

Adaptive Precision for EXpert Models: MoE-aware mixed-precision quantization

What it solves

APEX는 Mixture-of-Experts (MoE) 모델의 균일 양자화(uniform quantization)의 비효율성을 해결합니다. 표준 양자화는 종종 모든 가중치를 동일하게 취급하여, 모델 크기가 과도하게 커지거나 불필요한 정밀도 손실이 발생합니다. APEX는 정확도를 희생하지 않으면서 모델 크기를 줄이고 추론 속도를 높여, 대규모 MoE 모델이 소비자용 하드웨어(예: 16GB VRAM GPU)에서 전체 정밀도 모델의 품질을 유지하거나 능가하면서 실행될 수 있도록 합니다.

How it works

APEX는 MoE 모델의 구조적 특성에 맞게 특별히 설계된 혼합 정밀도(mixed-precision) 전략을 사용합니다:

  • Tensor Classification: 가중치를 라우팅된 전문가(routed experts, 더 희소하고 더 많이 압축할 수 있음), 공유 전문가(shared experts, 중요하며 높은 정밀도가 필요함), 그리고 attention/SSM 가중치로 분류합니다.
  • Layer-wise Precision Gradient: 노이즈에 더 민감한 "edge" 레이어(처음과 마지막 몇 개의 레이어)에는 더 높은 정밀도를 할당하고, 중복되는 중간 레이어에는 더 낮은 정밀도를 할당합니다.
  • Diverse Calibration: "I-variants"는 단순히 Wikipedia만 사용하는 대신 채팅, 코드, 추론을 아우르는 캘리브레이션 데이터셋을 사용하여 실제 작업 성능을 향상시킵니다.
  • llama.cpp Integration: stock llama.cpp의 --tensor-type-file--tensor-type 플래그를 활용하여 별도의 코드 변경 없이 이러한 특정 정밀도 할당을 적용할 수 있습니다.

Who it’s for

제한된 하드웨어에서 대규모 MoE 모델을 배포하고자 하는 개발자와 AI 연구자, 특히 GGUF 포맷과 llama.cpp 생태계를 사용하는 분들을 대상으로 합니다.

Highlights

  • High Efficiency: Q8_0 perplexity를 절반 크기에서 능가하며, Unsloth Dynamic 양자화보다 속도와 크기 면에서 더 뛰어납니다.
  • Five Precision Tiers: "I-Quality" (최대 정확도)부터 "Mini" (16GB VRAM을 위한 가장 작은 실행 가능한 크기)까지 다양한 구성을 제공합니다.
  • Lossless Compression: 일부 지표에서 전체 Q8_0 품질과 일치하거나 능가하며, 크기는 훨씬 더 작습니다.
  • Hardware Accessible: RTX 4060 Ti 16GB와 같은 소비자용 GPU에서 35B MoE 모델을 실행할 수 있게 합니다.
  • Zero Code Changes: 표준 llama.cpp 및 LocalAI와 함께 작동합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch