Tencent/AngelSlim

Model compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.

解决的问题

AngelSlim 是一个旨在使大模型压缩更易访问和高效的综合性工具包。它解决了在有限硬件上部署大型 AI 模型(如 LLM、VLM 和 Diffusion 模型)的挑战,通过提供一个统一的框架来减小模型尺寸并提升推理速度,同时保持性能损失最小。

工作原理

该工具包将多种先进的压缩策略整合到一个易于使用的框架中:

  • 量化:支持多种格式,包括 FP8、INT8、INT4(GPTQ/AWQ),以及超低比特宽度如 1.25 位(Sherry)和三值量化(Tequila)。
  • 推测解码:使用草稿模型预测 token,再由目标模型验证。包含 AngelSpec 框架,采用解耦设计,推理和训练在不同的 GPU 池中运行,用于训练这些草稿模型。
  • 稀疏注意力:实现 Stem 和 MInference 等算法,通过动态选择关键块来加速长上下文模型的预填充阶段。
  • 蒸馏:提供量化感知蒸馏,将大型模型的知识迁移到更小的压缩版本中。
  • 模型特定优化:包含针对不同模态的专用技术,例如 VLM 的 token 剪枝和 Diffusion 模型的缓存(DeepCache、TeaCache)。

适用人群

适用于需要在各种硬件上优化大规模模型部署的 AI 开发者和研究人员,从高端服务器到消费级笔记本电脑(例如在 4090 GPU 上运行 214GB 模型)。

主要亮点

  • 广泛模型支持:支持 LLM(Hunyuan、Qwen、DeepSeek)、VLM(Qwen-VL)、Diffusion 模型(FLUX、SDXL)和语音模型。
  • 跨平台兼容:可与 vLLM、SGLang 和 HuggingFace 等主流后端集成。
  • 极致压缩:可将模型从 TB 级压缩至数百 GB,性能下降极小。
  • 集成训练:包含 AngelSpec,一个支持长序列训练和多节点扩展的 torch 原生框架,用于训练推测解码的草稿模型。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目