bitsandbytes-foundation/bitsandbytes

Accessible large language models via k-bit quantization for PyTorch.

解決的問題

降低執行與訓練大型語言模型(LLMs)的記憶體需求,使其能在VRAM/RAM受限的硬體上運行,進而更具可存取性。

工作原理

該套件使用k位量化來壓縮模型權重與最佳化器狀態。提供三種主要方法:

  • 8位最佳化器:使用區塊式量化,在維持32位效能的同時降低最佳化器的記憶體成本。
  • LLM.int8():一種用於推論的8位量化方法,對大多數特徵使用向量式量化,對異常值使用16位矩陣乘法以防止效能損失。
  • QLoRA:一種用於訓練的4位量化方法,將模型壓縮至4位,並加入小型可訓練的低秩適應(LoRA)權重。

適用對象

需要在消費級硬體或計算資源有限的環境下執行或微調大型模型的開發者與研究人員。

主要亮點

  • 支援4位與8位量化原語。
  • 廣泛支援Linux、Windows與macOS,包含NVIDIA、AMD與Intel GPU以及CPU。
  • 與Hugging Face Transformers、Diffusers與PEFT等流行套件整合。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案