bitsandbytes-foundation/bitsandbytes

Accessible large language models via k-bit quantization for PyTorch.

何を解決するか

大規模言語モデル(LLM)の実行および学習に必要なメモリを削減し、VRAM/RAMが限られたハードウェアでも実行可能にするため、よりアクセスしやすくなります。

仕組み

このライブラリはkビット量子化を使用してモデル重みと最適化器状態を圧縮します。主に以下の3つの方法を提供します:

  • 8ビット最適化器:ブロック単位の量子化を使用して、32ビットのパフォーマンスを維持しながら最適化器のメモリコストを削減します。
  • LLM.int8():推論用の8ビット量子化手法で、大部分の特徴に対してベクトル単位の量子化を行い、外れ値に対しては16ビット行列乗算を使用してパフォーマンスの低下を防ぎます。
  • QLoRA:学習用の4ビット量子化手法で、モデルを4ビットに圧縮し、小さな学習可能な低ランク適応(LoRA)重みを追加します。

対象ユーザー

消費向けハードウェアや限られた計算リソース上で大規模モデルを実行または微調整したい開発者や研究者です。

特徴

  • 4ビットおよび8ビット量子化プリミティブのサポート。
  • NVIDIA、AMD、Intel GPUおよびCPUを含む、Linux、Windows、macOSにおける広範なハードウェア対応。
  • Hugging Face Transformers、Diffusers、PEFTなどの人気ライブラリとの統合。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト