localai-org/apex-quant

Adaptive Precision for EXpert Models: MoE-aware mixed-precision quantization

解決的問題

APEX 解決了混合專家(Mixture-of-Experts, MoE)模型中均勻量化效率低下的問題。標準量化通常對所有權重一視同仁,導致模型尺寸過大或不必要的精度損失。APEX 在不犧牲精度的前提下,縮小模型體積並提升推論速度,使大型 MoE 模型能在消費級硬體(如 16GB VRAM GPU)上運行,同時保持或超越全精度模型的品質。

工作原理

APEX 採用專為 MoE 模型結構特性設計的混合精度策略:

  • 張量分類:將權重分為路由專家(稀疏,可進一步壓縮)、共享專家(關鍵,需高精度)以及注意力/SSM 權重。
  • 分層精度梯度:為對雜訊更敏感的「邊緣」層(前幾層和最後幾層)分配更高精度,而為冗餘的中間層分配較低精度。
  • 多樣化校準:"I-variants" 使用涵蓋聊天、程式碼和推理的校準資料集,而非僅 Wikipedia,從而提升實際任務表現。
  • llama.cpp 集成:利用 stock llama.cpp 中的 --tensor-type-file--tensor-type 標誌,無需修改程式碼即可應用特定精度分配。

適用對象

希望在有限硬體上部署大型 MoE 模型的開發者與 AI 研究人員,特別是使用 GGUF 格式和 llama.cpp 生態系統的使用者。

主要亮點

  • 高效率:在體積減半的情況下,超越 Q8_0 的困惑度,並在速度與體積上優於 Unsloth Dynamic 量化。
  • 五種精度層級:提供從 "I-Quality"(最高精度)到 "Mini"(16GB VRAM 可運行的最小可行體積)的多種配置。
  • 無損壓縮:在某些指標上達到或超越全 Q8_0 品質,同時模型顯著更小。
  • 硬體可存取性:可在消費級 GPU(如 RTX 4060 Ti 16GB)上運行 35B MoE 模型。
  • 零程式碼變更:與標準 llama.cpp 和 LocalAI 兼容,無需任何程式碼修改即可使用。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch