lyogavin/airllm
AirLLM 70B inference with single 4GB GPU
What it solves
AirLLM は、消費者向けハードウェアでも VRAM が極端に限られている環境でも、巨大な大規模言語モデル(LLM)を実行できるようにします。12GB VRAM の GPU でも 671B パラメータ(DeepSeek‑V3 など)のモデルを、4GB カードでも 70B モデルを、量子化・蒸留・プルーニングなしで実行可能です。
How it works
モデル全体を GPU メモリにロードするのではなく、AirLLM はモデルを層単位で分割して保存します。推論時には GPU 上にモデルの 1 層だけを保持するため、VRAM の必要量はモデル全体ではなく単一層のサイズで決まります。また、オプションでブロック単位の量子化(4 ビットまたは 8 ビット)をサポートし、ディスク上の重みサイズを削減し、ロード時間を最大 3 倍高速化します。
Who it’s for
低価格の汎用コンピュータやホビイスト向け GPU 上で、重い量子化による精度低下なしに最先端の大規模オープンソース LLM を走らせたい開発者・研究者向けです。
Highlights
- Extreme VRAM Efficiency: Run 405B Llama 3.1 on 8GB VRAM or DeepSeek-V3 (671B) on 12GB VRAM.
- Broad Model Support: Works with Llama (2/3/3.1/3.3/4), Qwen, DeepSeek, Mistral, Mixtral, Phi, Gemma, ChatGLM, and more.
- No-Quantization Option: Capability to run models in full precision without needing pruning or distillation.
- Cross-Platform: Supports Linux and Apple Silicon (MacOS).
- Coded for Simplicity: Uses a single
AutoModelclass to automatically detect and load models from Hugging Face.