bitsandbytes-foundation/bitsandbytes

Accessible large language models via k-bit quantization for PyTorch.

해결하는 문제

대규모 언어 모델(LLM)을 실행하고 학습하기 위한 메모리 요구량을 줄여, VRAM/RAM이 제한된 하드웨어에서도 사용 가능하게 만듭니다.

작동 방식

이 라이브러리는 k비트 양자화를 사용하여 모델 가중치와 최적화기 상태를 압축합니다. 주로 세 가지 방법을 제공합니다:

  • 8비트 최적화기: 블록 단위 양자화를 사용하여 최적화기의 메모리 비용을 줄이면서도 32비트 성능을 유지합니다.
  • LLM.int8(): 추론용 8비트 양자화 방법으로, 대부분의 특징에 대해 벡터 단위 양자화를 사용하고, 이상치에는 16비트 행렬 곱셈을 사용하여 성능 저하를 방지합니다.
  • QLoRA: 학습용 4비트 양자화 방법으로, 모델을 4비트로 압축하고 작은 학습 가능한 저랭크 적응(LoRA) 가중치를 추가합니다.

대상 사용자

소비자용 하드웨어나 제한된 컴퓨팅 자원에서 대규모 모델을 실행하거나 미세 조정하고자 하는 개발자 및 연구자입니다.

주요 특징

  • 4비트 및 8비트 양자화 원시 기능 지원.
  • NVIDIA, AMD, Intel GPU 및 CPU를 포함한 Linux, Windows, macOS 전반에 걸친 광범위한 하드웨어 지원.
  • Hugging Face Transformers, Diffusers, PEFT와 같은 인기 있는 라이브러리와의 통합.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트