microsoft/VPTQ
VPTQ, A Flexible and Extreme low-bit quantization algorithm
해결하는 문제
VPTQ는 높은 정확도를 유지하고 추론 오버헤드를 최소화하면서, 재학습 없이 대규모 언어 모델(LLM)을 매우 낮은 비트 폭(2비트 미만)으로 압축하는 과제를 해결합니다.
작동 원리
**벡터 양자화(Vector Quantization)**를 기반으로 한 새로운 포스트 트레이닝 양자화(PTQ) 방법을 활용합니다. 이 접근 방식은 거대 모델(예: Llama-3.1 405B)을 1-2비트로 압축할 수 있게 해줍니다. 프로세스는 가볍게 설계되어 405B 파라미터 모델을 양자화하는 데 약 17시간이 소요됩니다.
대상
메모리가 제한된 하드웨어(예: 단일 RTX 4090에서 70B 모델 실행)에 거대 LLM을 배포해야 하는 AI 개발자 및 연구자, 그리고 낮은 디코딩 오버헤드로 높은 처리량을 가진 추론을 원하는 사용자.
주요 특징
- 극한의 압축: 최대 405B 파라미터 모델에 대해 2비트 미만 압축 지원.
- 높은 효율성: 가벼운 양자화 알고리즘과 최적화된 TTFT(Time To First Token) 및 처리량을 통한 민첩한 추론.
- 폭넓은 통합: Hugging Face Transformers 라이브러리에 통합됨.
- 광범위한 모델 지원: Llama 3.1/3.3, DeepSeek R1, Mistral, Qwen을 포함한 다양한 모델 제품군과 호환.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트