lyogavin/airllm
AirLLM 70B inference with single 4GB GPU
What it solves
AirLLM은 소비자용 하드웨어, 특히 VRAM이 매우 제한된 환경에서도 거대한 대규모 언어 모델(LLM)을 실행할 수 있게 해줍니다. 12GB VRAM GPU에서도 671B 파라미터(DeepSeek‑V3 등) 모델을, 4GB 카드에서도 70B 모델을 양자화, 증류, 프루닝 없이 실행할 수 있습니다.
How it works
전체 모델을 GPU 메모리에 로드하는 대신, AirLLM은 모델을 레이어 단위로 분해하여 저장합니다. 추론 시에는 GPU에 모델의 한 레이어만 유지하므로 VRAM 요구량은 전체 모델 크기가 아니라 단일 레이어 크기에 의해 결정됩니다. 또한 선택적으로 블록 단위 양자화(4비트 또는 8비트)를 지원해 디스크상의 가중치 크기를 줄이고 로딩 시간을 최대 3배 가속화합니다.
Who it’s for
무거운 양자화로 인한 정확도 손실 없이 저가형 일반 컴퓨터나 취미용 GPU에서 최첨단 대규모 오픈소스 LLM을 실행하고자 하는 개발자·연구자를 위한 솔루션입니다.
Highlights
- Extreme VRAM Efficiency: Run 405B Llama 3.1 on 8GB VRAM or DeepSeek-V3 (671B) on 12GB VRAM.
- Broad Model Support: Works with Llama (2/3/3.1/3.3/4), Qwen, DeepSeek, Mistral, Mixtral, Phi, Gemma, ChatGLM, and more.
- No-Quantization Option: Capability to run models in full precision without needing pruning or distillation.
- Cross-Platform: Supports Linux and Apple Silicon (MacOS).
- Coded for Simplicity: Uses a single
AutoModelclass to automatically detect and load models from Hugging Face.