Tencent/AngelSlim

Model compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.

What it solves

AngelSlim 是一個全面的工具包,旨在讓大型模型壓縮變得更加易於使用、高效且整合。它透過提供一個統一的框架來縮小模型大小並提高推理速度,且不會造成顯著的品質損失,從而解決了與部署大型模型(LLM、VLM、Diffusion 和 Speech 模型)相關的高昂計算和記憶體成本問題。

How it works

該工具包將各種主流的壓縮策略整合到單一引擎中,允許開發者根據模型類型和預期結果應用不同的技術:

  • Quantization: 支持廣泛的格式,包括 FP8 (Static/Dynamic), INT8, INT4 (GPTQ/AWQ/GPTAQ), NVFP4, 以及極低位元量化,如 Tequila (ternary) 和 Sherry (1.25-bit)。
  • Speculative Decoding: 實作了 Eagle3, SpecExit, 和 DFlare 等框架,以加速 token 生成。
  • Sparse Attention & Pruning: 使用 Stem 演算法在長文本 LLM 中進行塊狀稀疏注意力機制,並使用 IDPruner 進行 VLM 的視覺 token 剪枝。
  • Distillation: 為全精度和 QAT 風格的模型提供量化蒸餾支持。
  • Diffusion-Specific Optimizations: 為圖像和影片生成模型提供 FP8 量化和緩存機制(DeepCache, TeaCache, TaylorCache)。

Who it’s for

它適用於需要在資源受限的硬體(例如單個 GPU 或裝置端環境)上部署大型模型,以及尋求優化模型推理端到端延遲的 AI 開發者和研究人員。

Highlights

  • Broad Model Support: 支援 LLM (Hunyuan, Qwen, DeepSeek, GLM), VLM (Qwen-VL), Diffusion 模型 (FLUX, SDXL, Wan), 以及 Speech 模型 (Qwen-Omni)。
  • Unified Interface: 透過設定檔或 Python API (Engine) 提供「一鍵式」體驗,以執行複雜的壓縮工作流。
  • Extreme Quantization: 支援尖端的低位元格式,包括 1.25-bit 和三元量化。
  • Deployment Ready: 提供用於透過 vLLM 和 SGLang 等業界標準框架部署壓縮模型的腳本。