localai-org/apex-quant

Adaptive Precision for EXpert Models: MoE-aware mixed-precision quantization

What it solves

APEX 解决了 Mixture-of-Experts (MoE) 模型中均匀量化效率低下的问题。标准量化通常平等地对待所有权重,导致模型体积过大或不必要的精度损失。APEX 在不牺牲准确性的情况下减少了模型大小并提高了推理速度,使得大型 MoE 模型能够在消费级硬件(如 16GB VRAM GPU)上运行,同时保持或超过全精度模型的质量。

How it works

APEX 使用专门为 MoE 模型的结构特性设计的混合精度策略:

  • Tensor Classification: 它将权重分类为路由专家 (routed experts)(它们是稀疏的,可以进行更多压缩)、共享专家 (shared experts)(它们是关键的,需要高精度)以及 attention/SSM 权重。
  • Layer-wise Precision Gradient: 它为对噪声更敏感的“边缘”层(前几层和最后几层)分配更高的精度,并为冗余的中间层分配较低的精度。
  • Diverse Calibration: “I-variants” 使用涵盖聊天、代码和推理的校准数据集,而不仅仅是 Wikipedia,从而提高了实际任务的性能。
  • llama.cpp Integration: 它利用了 stock llama.cpp 中的 --tensor-type-file--tensor-type 标志,无需修改自定义代码即可应用这些特定的精度分配。

Who it’s for

希望在有限的硬件上部署大型 MoE 模型,特别是使用 GGUF 格式和 llama.cpp 生态系统的开发者和 AI 研究人员。

Highlights

  • High Efficiency: 在体积减半的情况下,其困惑度 (perplexity) 优于 Q8_0,并且在速度和体积方面优于 Unsloth Dynamic 量化。
  • Five Precision Tiers: 提供从 "I-Quality"(最高准确度)到 "Mini"(16GB VRAM 的最小可行体积)的配置。
  • Lossless Compression: 在某些指标上达到或超过全 Q8_0 质量,同时体积显著减小。
  • Hardware Accessible: 使能够在 RTX 4060 Ti 16GB 等消费级 GPU 上运行 35B MoE 模型。
  • Zero Code Changes: 可与标准 llama.cpp 和 LocalAI 配合使用。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch