Tencent/AngelSlim
Model compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.
何を解決するか
AngelSlim は、大規模モデル圧縮をよりアクセスしやすく、効率的に行えるように設計された包括的なツールキットです。LLM、VLM、Diffusionモデルなどの巨大AIモデルを限られたハードウェア上で展開する課題に対処し、性能の大幅な低下を伴わずにモデルサイズを削減し、推論速度を向上させる統合フレームワークを提供します。
仕組み
このツールキットは、複数の高度な圧縮戦略を1つの使いやすいフレームワークに統合しています。
- 量子化: FP8、INT8、INT4(GPTQ/AWQ)、1.25ビット(Sherry)や3値量子化(Tequila)など、幅広いフォーマットをサポート。
- 予測的デコード: ドラフトモデルを使ってトークンを予測し、ターゲットモデルで検証します。分散設計により推論と学習を別々のGPUプールで実行する「AngelSpec」フレームワークを含み、これらのドラフトモデルの学習を可能にします。
- スパースアテンション: StemやMInferenceなどのアルゴリズムを実装し、長文コンテキストモデルのプレフィル段階を、キーブロックを動的に選択することで高速化します。
- 知識蒸留: 大きなモデルから小さな圧縮モデルへの知識移行を可能にする、量子化対応の蒸留機能を提供。
- モデル固有の最適化: VLM向けのトークン削減や、Diffusionモデル向けのキャッシュ(DeepCache、TeaCache)など、異なるモダリティに特化した技術を含みます。
対象ユーザー
大規模モデルを、ハイエンドサーバーからコンシューマー向けラップトップ(例:4090 GPUで214GBモデルを実行)まで、さまざまなハードウェア上で展開・最適化したいAI開発者や研究者向けです。
主な特徴
- 広範なモデル対応: LLM(Hunyuan、Qwen、DeepSeek)、VLM(Qwen-VL)、Diffusionモデル(FLUX、SDXL)、音声モデルなどに対応。
- クロスオーバー互換性: vLLM、SGLang、HuggingFaceなどの人気バックエンドと統合可能。
- 極限的な圧縮: テラバイトから数百ギガバイトまでモデルを圧縮可能で、性能低下は最小限に抑えられます。
- 統合型学習: 長文シーケンス学習とマルチノードスケーリングをサポートする、torchネイティブな「AngelSpec」フレームワークを内蔵。予測的デコード用ドラフトモデルの学習を可能にします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト