localai-org/apex-quant
Adaptive Precision for EXpert Models: MoE-aware mixed-precision quantization
What it solves
APEX 解决了 Mixture-of-Experts (MoE) 模型中均匀量化效率低下的问题。标准量化通常平等地对待所有权重,导致模型体积过大或不必要的精度损失。APEX 在不牺牲准确性的情况下减少了模型大小并提高了推理速度,使得大型 MoE 模型能够在消费级硬件(如 16GB VRAM GPU)上运行,同时保持或超过全精度模型的质量。
How it works
APEX 使用专门为 MoE 模型的结构特性设计的混合精度策略:
- Tensor Classification: 它将权重分类为路由专家 (routed experts)(它们是稀疏的,可以进行更多压缩)、共享专家 (shared experts)(它们是关键的,需要高精度)以及 attention/SSM 权重。
- Layer-wise Precision Gradient: 它为对噪声更敏感的“边缘”层(前几层和最后几层)分配更高的精度,并为冗余的中间层分配较低的精度。
- Diverse Calibration: “I-variants” 使用涵盖聊天、代码和推理的校准数据集,而不仅仅是 Wikipedia,从而提高了实际任务的性能。
- llama.cpp Integration: 它利用了 stock llama.cpp 中的
--tensor-type-file和--tensor-type标志,无需修改自定义代码即可应用这些特定的精度分配。
Who it’s for
希望在有限的硬件上部署大型 MoE 模型,特别是使用 GGUF 格式和 llama.cpp 生态系统的开发者和 AI 研究人员。
Highlights
- High Efficiency: 在体积减半的情况下,其困惑度 (perplexity) 优于 Q8_0,并且在速度和体积方面优于 Unsloth Dynamic 量化。
- Five Precision Tiers: 提供从 "I-Quality"(最高准确度)到 "Mini"(16GB VRAM 的最小可行体积)的配置。
- Lossless Compression: 在某些指标上达到或超过全 Q8_0 质量,同时体积显著减小。
- Hardware Accessible: 使能够在 RTX 4060 Ti 16GB 等消费级 GPU 上运行 35B MoE 模型。
- Zero Code Changes: 可与标准 llama.cpp 和 LocalAI 配合使用。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch