bitsandbytes: PyTorch용 k-bit 양자화 라이브러리로 LLM 추론 및 훈련의 메모리 소비를 줄입니다

TITLE: bitsandbytes: PyTorch용 k-bit 양자화 라이브러리로 LLM 추론 및 훈련의 메모리 소비를 줄입니다

BODY:

bitsandbytes: PyTorch용 k-bit 양자화 라이브러리로 LLM 추론 및 훈련의 메모리 소비를 줄입니다

해결하는 문제

대규모 언어 모델(LLM)의 실행 및 훈련에 필요한 메모리 요구 사항을 줄여, 제한된 VRAM/RAM을 가진 하드웨어에서도 실행할 수 있게 함으로써 접근성을 높입니다.

작동 방식

  • 8-bit 옵티마이저: 블록 단위 양자화를 사용하여 성능을 유지하면서 옵티마이저의 메모리 비용을 크게 줄입니다.
  • LLM.int8(): 추론을 위한 8-bit 양자화를 가능하게 하며, 대부분의 특성에 대해 벡터 단위 양자화를 사용하고 이상치에 대해서는 16-bit 행렬 곱셈을 사용하여 성능 저하를 방지합니다.
  • QLoRA: 훈련을 위한 4-bit 양자화를 구현하며, 저순위 적응(LoRA) 가중치와 양자화를 결합하여 효율적인 파인튜닝을 가능하게 합니다.

대상

소비자 등급 또는 제한된 리소스 하드웨어에서 대형 모델을 배포하거나 파인튜닝해야 하는 PyTorch를 사용하는 개발자와 연구자.

주요 특징

  • 4-bit 및 8-bit 양자화 프리미티브 지원.
  • NVIDIA, AMD, Intel GPU 및 Linux, Windows, macOS에서의 CPU를 포함한 광범위한 하드웨어 가속기 지원.
  • Hugging Face 생태계(Transformers, Diffusers, PEFT)와의 통합.
  • 모델 성능을 유지하면서 메모리를 절약하는 기술.

SUMMARY: 4-bit 및 8-bit 양자화를 통해 추론 및 훈련 모두에서 접근 가능한 대규모 언어 모델을 가능하게 하는 PyTorch 라이브러리.

Sources