microsoft/VPTQ

VPTQ, A Flexible and Extreme low-bit quantization algorithm

해결하는 문제

VPTQ는 높은 정확도를 유지하고 추론 오버헤드를 최소화하면서, 재학습 없이 대규모 언어 모델(LLM)을 매우 낮은 비트 폭(2비트 미만)으로 압축하는 과제를 해결합니다.

작동 원리

**벡터 양자화(Vector Quantization)**를 기반으로 한 새로운 포스트 트레이닝 양자화(PTQ) 방법을 활용합니다. 이 접근 방식은 거대 모델(예: Llama-3.1 405B)을 1-2비트로 압축할 수 있게 해줍니다. 프로세스는 가볍게 설계되어 405B 파라미터 모델을 양자화하는 데 약 17시간이 소요됩니다.

대상

메모리가 제한된 하드웨어(예: 단일 RTX 4090에서 70B 모델 실행)에 거대 LLM을 배포해야 하는 AI 개발자 및 연구자, 그리고 낮은 디코딩 오버헤드로 높은 처리량을 가진 추론을 원하는 사용자.

주요 특징

  • 극한의 압축: 최대 405B 파라미터 모델에 대해 2비트 미만 압축 지원.
  • 높은 효율성: 가벼운 양자화 알고리즘과 최적화된 TTFT(Time To First Token) 및 처리량을 통한 민첩한 추론.
  • 폭넓은 통합: Hugging Face Transformers 라이브러리에 통합됨.
  • 광범위한 모델 지원: Llama 3.1/3.3, DeepSeek R1, Mistral, Qwen을 포함한 다양한 모델 제품군과 호환.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트