lyogavin/airllm
AirLLM 70B inference with single 4GB GPU
解决的问题
AirLLM 允许用户在 VRAM 极其有限的消费级硬件上运行巨大的大语言模型(LLM)。它无需量化、蒸馏或剪枝,即可将超大模型(如 Llama 3.1 405B 或 DeepSeek-V3 671B)部署到仅拥有 4GB 到 12GB 内存的单个 GPU 上。
工作原理
AirLLM 不会将整个模型加载到 GPU 内存中,而是将模型分解并逐层流式传输。通过每次仅在 GPU 上保留一层,VRAM 的需求由单层大小决定,而非整个模型的大小。对于稀疏的混合专家(MoE)模型,它进一步优化,仅流式传输实际被 token 路由到的专家。
适用人群
希望在低性能通用计算机或单个爱好者级 GPU 卡上运行前沿高参数 LLM,且不牺牲模型精度的开发者和研究人员。
主要亮点
- 极致内存效率:可在 4GB VRAM 上运行 70B 模型,在约 12GB VRAM 上运行 671B 模型。
- 广泛模型支持:兼容 Llama、Qwen、DeepSeek、Mistral、Mixtral、Phi、Gemma 和 Kimi K3。
- 广泛硬件支持:支持 Linux、Windows 和 Apple Silicon(macOS)。
- 可选加速:支持按块量化(4 位或 8 位),可减少磁盘加载瓶颈,将推理速度提升最高达 3 倍。
- 简单集成:使用与 Hugging Face transformers API 类似的
AutoModel类,便于快速采用。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目