Tencent/AngelSlim

Model compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.

解決的問題

AngelSlim 是一個旨在使大模型壓縮更易存取且高效使用的綜合性工具包。它解決了在有限硬體上部署大型 AI 模型(如 LLM、VLM 和 Diffusion 模型)的挑戰,透過提供一個統一的框架來縮小模型尺寸並提升推論速度,同時保持性能損失最小。

工作原理

該工具包將多種先進的壓縮策略整合到一個易於使用的框架中:

  • 量化:支援多種格式,包括 FP8、INT8、INT4(GPTQ/AWQ),以及超低比特寬度如 1.25 位(Sherry)和三值量化(Tequila)。
  • 推測解碼:使用草稿模型預測 token,再由目標模型驗證。包含 AngelSpec 框架,採用解耦設計,推論和訓練在不同的 GPU 池中運行,用於訓練這些草稿模型。
  • 稀疏注意力:實現 Stem 和 MInference 等演算法,透過動態選擇關鍵區塊來加速長上下文模型的預填入階段。
  • 蒸餾:提供量化感知蒸餾,將大型模型的知識遷移至更小的壓縮版本中。
  • 模型特定優化:包含針對不同模態的專用技術,例如 VLM 的 token 剪枝和 Diffusion 模型的快取(DeepCache、TeaCache)。

適用對象

適用於需要在各種硬體上優化大規模模型部署的 AI 開發者與研究人員,從高階伺服器到消費級筆電(例如在 4090 GPU 上執行 214GB 模型)。

主要亮點

  • 廣泛模型支援:支援 LLM(Hunyuan、Qwen、DeepSeek)、VLM(Qwen-VL)、Diffusion 模型(FLUX、SDXL)和語音模型。
  • 跨平台相容:可與 vLLM、SGLang 和 HuggingFace 等主流後端整合。
  • 極致壓縮:可將模型從 TB 級壓縮至數百 GB,性能下降極小。
  • 整合訓練:包含 AngelSpec,一個支援長序列訓練和多節點擴展的 torch 原生框架,用於訓練推測解碼的草稿模型。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案