bitsandbytes-foundation/bitsandbytes

Accessible large language models via k-bit quantization for PyTorch.

解决的问题

降低运行和训练大语言模型(LLMs)的内存需求,使其在VRAM/RAM受限的硬件上也能运行,从而更具可访问性。

工作原理

该库使用k比特量化来压缩模型权重和优化器状态。它提供三种主要方法:

  • 8位优化器:使用块级量化,在保持32位性能的同时降低优化器的内存开销。
  • LLM.int8():一种用于推理的8位量化方法,对大多数特征使用向量级量化,对异常值使用16位矩阵乘法以防止性能损失。
  • QLoRA:一种用于训练的4位量化方法,将模型压缩至4位,并添加小型可训练的低秩适配(LoRA)权重。

适用人群

需要在消费级硬件或计算资源有限的环境下运行或微调大型模型的开发者和研究人员。

主要亮点

  • 支持4位和8位量化原语。
  • 广泛支持Linux、Windows和macOS,包括NVIDIA、AMD和Intel GPU以及CPU。
  • 与Hugging Face Transformers、Diffusers和PEFT等流行库集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目