localai-org/apex-quant
Adaptive Precision for EXpert Models: MoE-aware mixed-precision quantization
解決的問題
APEX 解決了混合專家(Mixture-of-Experts, MoE)模型中均勻量化效率低下的問題。標準量化通常對所有權重一視同仁,導致模型尺寸過大或不必要的精度損失。APEX 在不犧牲精度的前提下,縮小模型體積並提升推論速度,使大型 MoE 模型能在消費級硬體(如 16GB VRAM GPU)上運行,同時保持或超越全精度模型的品質。
工作原理
APEX 採用專為 MoE 模型結構特性設計的混合精度策略:
- 張量分類:將權重分為路由專家(稀疏,可進一步壓縮)、共享專家(關鍵,需高精度)以及注意力/SSM 權重。
- 分層精度梯度:為對雜訊更敏感的「邊緣」層(前幾層和最後幾層)分配更高精度,而為冗餘的中間層分配較低精度。
- 多樣化校準:"I-variants" 使用涵蓋聊天、程式碼和推理的校準資料集,而非僅 Wikipedia,從而提升實際任務表現。
- llama.cpp 集成:利用 stock llama.cpp 中的
--tensor-type-file和--tensor-type標誌,無需修改程式碼即可應用特定精度分配。
適用對象
希望在有限硬體上部署大型 MoE 模型的開發者與 AI 研究人員,特別是使用 GGUF 格式和 llama.cpp 生態系統的使用者。
主要亮點
- 高效率:在體積減半的情況下,超越 Q8_0 的困惑度,並在速度與體積上優於 Unsloth Dynamic 量化。
- 五種精度層級:提供從 "I-Quality"(最高精度)到 "Mini"(16GB VRAM 可運行的最小可行體積)的多種配置。
- 無損壓縮:在某些指標上達到或超越全 Q8_0 品質,同時模型顯著更小。
- 硬體可存取性:可在消費級 GPU(如 RTX 4060 Ti 16GB)上運行 35B MoE 模型。
- 零程式碼變更:與標準 llama.cpp 和 LocalAI 兼容,無需任何程式碼修改即可使用。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch