Tencent/AngelSlim

Model compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.

What it solves

AngelSlimは、大規模モデルの圧縮をよりアクセシブル、効率的、かつ統合的に行うために設計された包括的なツールキットです。大規模なモデル(LLM, VLM, Diffusion, および Speech モデル)のデプロイに伴う高い計算コストとメモリコストを解決するために、品質を大幅に損なうことなく、モデルのサイズを縮小し、推論速度を向上させるための統一的なフレームワークを提供します。

How it works

このツールキットは、さまざまな主流の圧縮戦略を単一のエンジンに統合しており、開発者がモデルのタイプや目的の結果に基づいて、異なる技術を適用できる仕組みになっています:

  • Quantization: FP8 (Static/Dynamic), INT8, INT4 (GPTQ/AWQ/GPTAQ), NVFP4, および Tequila (ternary) や Sherry (1.25-bit) のような極端な低ビット量化をサポートしています。

  • Speculative Decoding: Eagle3, SpecExit, および DFlare などのフレームワークを実装しています。token 生成を加速させます。

  • Sparse Attention & Pruning: 長文コンテキスト LLM のための block-sparse attention を実現する Stem 演算法を使用し、VLM のための vision token 枝刈りを行う IDPruner を使用しています。

  • Distillation: 全精度および QAT スタイルのモデルに対して、量化蒸留(quantized distillation)をサポートしています。

  • Diffusion-Specific Optimizations: 画像および動画生成モデルのための FP8 量化とキャッシュメカニズム(DeepCache, TeaCache, TaylorCache)を含んでいます。

Who it’s for

リソースが制限されたハードウェア(単一 GPU やデバイス上での環境)に大規模モデルをデプロイする場合、またはモデル推論の End-to-end 延滞(latency)を最適化したい AI 開発者や研究者向けです。

Highlights

  • Broad Model Support: LLM (Hunyuan, Qwen, DeepSeek, GLM), VLM (Qwen-VL), Diffusion モデル (FLUX, SDXL, Wan), および Speech モデル (Qwen-Omni) に対応しています。
  • Unified Interface: 設定ファイルまたは Python API (Engine) を介して、「one-click」体験を提供します。複雑な圧縮ワークフローを動かすことができます。
  • Extreme Quantization: 1.25-bit や三元量化(ternary quantization)を含む、最先端の低ビット形式をサポートしています。
  • Deployment Ready: vLLM や SGLang のような業界標準のフレームワークワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワークフレームワーク框架-based frameworks like vLLM and SGLang.