Tencent/AngelSlim
Model compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.
解決的問題
AngelSlim 是一個旨在使大模型壓縮更易存取且高效使用的綜合性工具包。它解決了在有限硬體上部署大型 AI 模型(如 LLM、VLM 和 Diffusion 模型)的挑戰,透過提供一個統一的框架來縮小模型尺寸並提升推論速度,同時保持性能損失最小。
工作原理
該工具包將多種先進的壓縮策略整合到一個易於使用的框架中:
- 量化:支援多種格式,包括 FP8、INT8、INT4(GPTQ/AWQ),以及超低比特寬度如 1.25 位(Sherry)和三值量化(Tequila)。
- 推測解碼:使用草稿模型預測 token,再由目標模型驗證。包含 AngelSpec 框架,採用解耦設計,推論和訓練在不同的 GPU 池中運行,用於訓練這些草稿模型。
- 稀疏注意力:實現 Stem 和 MInference 等演算法,透過動態選擇關鍵區塊來加速長上下文模型的預填入階段。
- 蒸餾:提供量化感知蒸餾,將大型模型的知識遷移至更小的壓縮版本中。
- 模型特定優化:包含針對不同模態的專用技術,例如 VLM 的 token 剪枝和 Diffusion 模型的快取(DeepCache、TeaCache)。
適用對象
適用於需要在各種硬體上優化大規模模型部署的 AI 開發者與研究人員,從高階伺服器到消費級筆電(例如在 4090 GPU 上執行 214GB 模型)。
主要亮點
- 廣泛模型支援:支援 LLM(Hunyuan、Qwen、DeepSeek)、VLM(Qwen-VL)、Diffusion 模型(FLUX、SDXL)和語音模型。
- 跨平台相容:可與 vLLM、SGLang 和 HuggingFace 等主流後端整合。
- 極致壓縮:可將模型從 TB 級壓縮至數百 GB,性能下降極小。
- 整合訓練:包含 AngelSpec,一個支援長序列訓練和多節點擴展的 torch 原生框架,用於訓練推測解碼的草稿模型。
相關
- 專案
- 專案
- 專案
- 專案
- 專案