Tencent/AngelSlim
Model compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.
What it solves
AngelSlim 是一个全面的工具包,旨在让大型模型压缩变得更加易于使用、高效且集成。它通过提供一个统一的框架来缩小模型大小并提高推理速度,且不会造成显著的质量损失,从而解决与部署大规模模型(LLM、VLM、Diffusion 和 Speech 模型)相关的高昂计算和内存成本问题。
How it works
该工具包将各种主流的压缩策略集成到单个引擎中,允许开发者根据模型类型和期望结果应用不同的技术:
- Quantization: 支持广泛的格式,包括 FP8 (Static/Dynamic), INT8, INT4 (GPTQ/AWQ/GPTAQ), NVFP4, 以及极低比特率量化,如 Tequila (ternary) 和 Sherry (1.25-bit)。
- Speculative Decoding: 实现 Eagle3, SpecExit, 和 DFlare 等框架,以加速 token 生成。
- Sparse Attention & Pruning: 使用 Stem 算法在长文本 LLM 中进行块状稀疏注意力机制,并使用 IDPruner 进行 VLM 的视觉 token 剪枝。
- Distillation: 为全精度和 QAT 风格的模型提供量化蒸馏支持。
- Diffusion-Specific Optimizations: 包括为图像和视频生成模型提供的 FP8 量化和缓存机制(DeepCache, TeaCache, TaylorCache)。
Who it’s for
它适用于需要将大型模型部署在资源受限的硬件(如单个 GPU 或端侧设备环境)上,以及寻求优化模型推理端到端延迟的 AI 开发者和研究人员。
Highlights
- Broad Model Support: 支持 LLM (Hunyuan, Qwen, DeepSeek, GLM), VLM (Qwen-VL), Diffusion 模型 (FLUX, SDXL, Wan), 以及 Speech 模型 (Qwen-Omni)。
- Unified Interface: 通过配置文件或 Python API (
Engine) 提供“一键式”体验,以运行复杂的压缩工作流。 - Extreme Quantization: 支持尖端的低比特率格式,包括 1.25-bit 和三元量化。
- Deployment Ready: 提供用于通过 vLLM 和 SGLang 等行业标准框架部署压缩模型的脚本。