Tencent/AngelSlim

Model compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.

何を解決するか

AngelSlim は、大規模モデル圧縮をよりアクセスしやすく、効率的に行えるように設計された包括的なツールキットです。LLM、VLM、Diffusionモデルなどの巨大AIモデルを限られたハードウェア上で展開する課題に対処し、性能の大幅な低下を伴わずにモデルサイズを削減し、推論速度を向上させる統合フレームワークを提供します。

仕組み

このツールキットは、複数の高度な圧縮戦略を1つの使いやすいフレームワークに統合しています。

  • 量子化: FP8、INT8、INT4(GPTQ/AWQ)、1.25ビット(Sherry)や3値量子化(Tequila)など、幅広いフォーマットをサポート。
  • 予測的デコード: ドラフトモデルを使ってトークンを予測し、ターゲットモデルで検証します。分散設計により推論と学習を別々のGPUプールで実行する「AngelSpec」フレームワークを含み、これらのドラフトモデルの学習を可能にします。
  • スパースアテンション: StemやMInferenceなどのアルゴリズムを実装し、長文コンテキストモデルのプレフィル段階を、キーブロックを動的に選択することで高速化します。
  • 知識蒸留: 大きなモデルから小さな圧縮モデルへの知識移行を可能にする、量子化対応の蒸留機能を提供。
  • モデル固有の最適化: VLM向けのトークン削減や、Diffusionモデル向けのキャッシュ(DeepCache、TeaCache)など、異なるモダリティに特化した技術を含みます。

対象ユーザー

大規模モデルを、ハイエンドサーバーからコンシューマー向けラップトップ(例:4090 GPUで214GBモデルを実行)まで、さまざまなハードウェア上で展開・最適化したいAI開発者や研究者向けです。

主な特徴

  • 広範なモデル対応: LLM(Hunyuan、Qwen、DeepSeek)、VLM(Qwen-VL)、Diffusionモデル(FLUX、SDXL)、音声モデルなどに対応。
  • クロスオーバー互換性: vLLM、SGLang、HuggingFaceなどの人気バックエンドと統合可能。
  • 極限的な圧縮: テラバイトから数百ギガバイトまでモデルを圧縮可能で、性能低下は最小限に抑えられます。
  • 統合型学習: 長文シーケンス学習とマルチノードスケーリングをサポートする、torchネイティブな「AngelSpec」フレームワークを内蔵。予測的デコード用ドラフトモデルの学習を可能にします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト