Tencent/AngelSlim

Model compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.

What it solves

AngelSlim은 대규모 모델 압축을 더 쉽게 접근 가능하고, 효율적이며, 통합적으로 만들 수 있도록 설계된 종합적인 툴킷입니다. 품질의 큰 손실 없이 모델 크기를 줄이고 추론 속도를 높이기 위한 통합 프레임워크를 제공함으로써, 대규모 모델(LLM, VLM, Diffusion, Speech 모델) 배포와 관련된 높은 계산 및 메모리 비용 문제를 해결합니다.

How it works

이 툴킷은 다양한 주류 압축 전략을 단일 엔진으로 통합하여, 개발자가 모델 유형과 원하는 결과에 따라 다양한 기술을 적용할 수 있도록 합니다:

  • Quantization: FP8 (Static/Dynamic), INT8, INT4 (GPTQ/AWQ/GPTAQ), NVFP4, 그리고 Tequila (ternary) 및 Sherry (1.25-bit)와 같은 극단적인 저비트 양자화를 포함한 광범위한 형식을 지원합니다.
  • Speculative Decoding: Eagle3, SpecExit, 및 DFlare와 같은 프레임워크를 구현하여 토큰 생성을 가속화합니다.
  • Sparse Attention & Pruning: 긴 문맥의 LLM을 위한 block-sparse attention에 Stem 알고리즘을 사용하고, VLM의 시각적 토큰 가지치기를 위한 IDPruner를 사용합니다.
  • Distillation: 전정밀도(full-precision) 및 QAT 스타일 모델 모두에 대해 양자화 증류를 지원합니다.
  • Diffusion-Specific Optimizations: 이미지 및 비디오 생성 모델을 위한 FP8 양자화 및 캐싱 메커니즘(DeepCache, TeaCache, TaylorCache)을 포함합니다.

Who it’s for

자원 제약이 있는 하드웨어(예: 단일 GPU 또는 온디바이스 환경)에 대규모 모델을 배포해야 하는 AI 개발자 및 연구자, 그리고 모델 추론의 엔드투엔드 지연 시간을 최적화하려는 사람들을 대상으로 합니다.

Highlights

  • Broad Model Support: LLM (Hunyuan, Qwen, DeepSeek, GLM), VLM (Qwen-VL), Diffusion 모델 (FLUX, SDXL, Wan), 그리고 Speech 모델 (Qwen-Omni)을 지원합니다.
  • Unified Interface: 설정 파일 또는 Python API (Engine)를 통해 복잡한 압축 워크플로우를 실행하는 "one-click" 경험을 제공합니다.
  • Extreme Quantization: 1.25-bit 및 ternary 양자화를 포함한 최첨단 저비트 형식을 지원합니다.
  • Deployment Ready: vLLM 및 SGLang과 같은 업계 표준 프레임워크를 통해 압축된 모델을 배포하기 위한 스크립트를 제공합니다.