bitsandbytes: PyTorch용 k-bit 양자화 라이브러리로 LLM 추론 및 훈련의 메모리 소비를 줄입니다
TITLE: bitsandbytes: PyTorch용 k-bit 양자화 라이브러리로 LLM 추론 및 훈련의 메모리 소비를 줄입니다
BODY:
bitsandbytes: PyTorch용 k-bit 양자화 라이브러리로 LLM 추론 및 훈련의 메모리 소비를 줄입니다
해결하는 문제
대규모 언어 모델(LLM)의 실행 및 훈련에 필요한 메모리 요구 사항을 줄여, 제한된 VRAM/RAM을 가진 하드웨어에서도 실행할 수 있게 함으로써 접근성을 높입니다.
작동 방식
- 8-bit 옵티마이저: 블록 단위 양자화를 사용하여 성능을 유지하면서 옵티마이저의 메모리 비용을 크게 줄입니다.
- LLM.int8(): 추론을 위한 8-bit 양자화를 가능하게 하며, 대부분의 특성에 대해 벡터 단위 양자화를 사용하고 이상치에 대해서는 16-bit 행렬 곱셈을 사용하여 성능 저하를 방지합니다.
- QLoRA: 훈련을 위한 4-bit 양자화를 구현하며, 저순위 적응(LoRA) 가중치와 양자화를 결합하여 효율적인 파인튜닝을 가능하게 합니다.
대상
소비자 등급 또는 제한된 리소스 하드웨어에서 대형 모델을 배포하거나 파인튜닝해야 하는 PyTorch를 사용하는 개발자와 연구자.
주요 특징
- 4-bit 및 8-bit 양자화 프리미티브 지원.
- NVIDIA, AMD, Intel GPU 및 Linux, Windows, macOS에서의 CPU를 포함한 광범위한 하드웨어 가속기 지원.
- Hugging Face 생태계(Transformers, Diffusers, PEFT)와의 통합.
- 모델 성능을 유지하면서 메모리를 절약하는 기술.
SUMMARY: 4-bit 및 8-bit 양자화를 통해 추론 및 훈련 모두에서 접근 가능한 대규모 언어 모델을 가능하게 하는 PyTorch 라이브러리.