Tencent/AngelSlim
Model compression toolkit engineered for enhanced usability, comprehensiveness, and efficiency.
해결하는 문제
AngelSlim은 대규모 모델 압축을 더 접근 가능하고 효율적으로 만들기 위해 설계된 포괄적인 툴킷입니다. LLM, VLM, Diffusion 모델과 같은 거대한 AI 모델을 제한된 하드웨어에 배포하는 과제를 해결하며, 성능 손실 없이 모델 크기를 줄이고 추론 속도를 높이는 통합 프레임워크를 제공합니다.
작동 방식
이 툴킷은 여러 고급 압축 전략을 하나의 사용하기 쉬운 프레임워크로 통합합니다.
- 양자화: FP8, INT8, INT4(GPTQ/AWQ), 1.25비트(Sherry), 삼치 양자화(Tequila) 등 다양한 포맷을 지원합니다.
- 예측 디코딩: 드래프트 모델을 사용해 토큰을 예측하고, 타겟 모델이 검증합니다. 추론과 학습을 별도의 GPU 풀에서 실행하는 분리 설계를 사용하는 AngelSpec 프레임워크를 포함하여 드래프트 모델을 훈련할 수 있습니다.
- 희소 어텐션: Stem과 MInference와 같은 알고리즘을 구현하여, 긴 컨텍스트 모델의 프리필 단계를 동적으로 키 블록을 선택함으로써 가속화합니다.
- 지식 증류: 더 큰 모델에서 더 작은 압축된 버전으로 지식을 전이할 수 있는 양자화 인식 증류를 제공합니다.
- 모델별 최적화: VLM용 토큰 제거 및 Diffusion 모델용 캐싱(DeepCache, TeaCache)과 같은 다양한 모달리티에 특화된 기술을 포함합니다.
대상 사용자
고성능 서버부터 소비자용 랩톱(예: 4090 GPU에서 214GB 모델 실행)까지 다양한 하드웨어에서 대규모 모델을 배포하기 위해 최적화가 필요한 AI 개발자 및 연구자에게 적합합니다.
주요 특징
- 광범위한 모델 지원: LLM(Hunyuan, Qwen, DeepSeek), VLM(Qwen-VL), Diffusion 모델(FLUX, SDXL), 음성 모델 등에 대응합니다.
- 크로스오버 호환성: vLLM, SGLang, HuggingFace와 같은 인기 있는 백엔드와 통합 가능합니다.
- 극한의 압축: 테라바이트에서 수백 기가바이트로 모델을 압축 가능하며, 성능 저하는 최소화됩니다.
- 통합 학습: 긴 시퀀스 학습과 다중 노드 스케일링을 지원하는 torch 네이티브 프레임워크인 AngelSpec을 포함하여, 예측 디코딩용 드래프트 모델을 학습할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트